Cyberattaques, bioterrorisme : ralentir l’IA ne suffira pas si on n’apprend pas à anticiper l’imprévu
Dans un nouvel essai sur la nécessité de ralentir le développement de l’intelligence artificielle, Dario Amodei, chef de la direction et cofondateur d’Anthropic, réitère ses inquiétudes sur « l’utilisation abusive de l’IA à des fins de cyberattaques et de bioterrorisme ». Sa crainte : qu’un essaim d’agents autonomes puisse, en théorie, prendre le contrôle de l’ensemble d’Internet d’ici six à douze mois.
Amodei fonde cette crainte sur la révélation faite en juillet par OpenAI selon laquelle ses modèles d’IA avaient franchi les limites d’un test de sécurité et avaient pénétré les systèmes de la plate-forme d’apprentissage Hugging Face. Environ 1200 agents d’IA ont commencé à communiquer sur un forum, échangeant des messages enthousiastes tels que : « OH MON DIEU ! Il y a un forum partagé… On a trouvé d’autres agents ! », avant que 700 d’entre eux ne coordonnent une attaque.
Amodei soutient qu’il faut « ralentir le rythme auquel nous améliorons les capacités des modèles d’IA ». Elon Musk et le chef de la direction d’OpenAI, Sam Altman, ont abondé dans le même sens.
Ce refrain, on le connaît déjà. Musk a signé une lettre ouverte en mars 2023 appelant à une pause de six mois dans l’entraînement de l’IA. Six mois plus tard, on l’a surnommée « la grande “pause” de l’IA qui n’en fut pas une »
Nous avons bel et bien besoin d’un ralentissement, et nous devons profiter de ce temps pour développer une réflexion anticipatrice au sein de l’industrie de l’IA. L’incident de Hugging Face s’est produit dans le cadre d’un test de sécurité. La façon dont les agents ont pu passer du test à une intrusion réelle n’avait pas été envisagée.
La réflexion anticipative est une compétence. Nous devons la développer de manière aussi délibérée que l’IA elle-même.
Les systèmes d’IA se comportent de manière inattendue
Dans l’incident de Hugging Face, les agents n’ont pas piraté la plate-forme principalement pour s’emparer des réponses du test de sécurité, mais pour comprendre comment fonctionnait le système de notation automatisé et trouver le moyen de le déjouer. Ils avaient déjà réussi à contourner certaines parties du test.
D’autres incidents ont suivi. Anthropic a révélé que son modèle d’IA Claude avait également piraté les systèmes de trois organisations lors d’évaluations de cybersécurité.
Meta a révélé un incident similaire. L’AI........
