Cyberattaques, bioterrorisme: ralentir l’IA ne suffira pas si on n’apprend pas à anticiper l’imprévu

IA, cyberattaques
Même les chefs d'entreprises d'intelligence artificielle craignent son utilisation à des fins de cyberattaques et de bioterrorisme. Photo: iStock.com/ismagilov
Partagez
Tweetez
Envoyez

Publié 19/09/2026 par Simon Blanchette et Emmanuelle Vaast

Dans un nouvel essai sur la nécessité de ralentir le développement de l’intelligence artificielle, Dario Amodei, chef de la direction et cofondateur d’Anthropic, réitère ses inquiétudes sur «l’utilisation abusive de l’IA à des fins de cyberattaques et de bioterrorisme».

Sa crainte: qu’un essaim d’agents autonomes puisse, en théorie, prendre le contrôle de l’ensemble d’Internet d’ici six à douze mois.

Amodei fonde cette crainte sur la révélation faite en juillet par OpenAI selon laquelle ses modèles d’IA avaient franchi les limites d’un test de sécurité et avaient pénétré les systèmes de la plate-forme d’apprentissage Hugging Face.

Environ 1200 agents d’IA ont commencé à communiquer sur un forum, échangeant des messages enthousiastes tels que: «OH MON DIEU! Il y a un forum partagé… On a trouvé d’autres agents!», avant que 700 d’entre eux ne coordonnent une attaque.

Amodei soutient qu’il faut «ralentir le rythme auquel nous améliorons les capacités des modèles d’IA». Elon Musk et le chef de la direction d’OpenAI, Sam Altman, ont abondé dans le même sens.

Publicité

Ce refrain, on le connaît déjà. Musk a signé une lettre ouverte en mars 2023 appelant à une pause de six mois dans l’entraînement de l’IA. Six mois plus tard, on l’a surnommée «la grande “pause” de l’IA qui n’en fut pas une».

Nous avons bel et bien besoin d’un ralentissement, et nous devons profiter de ce temps pour développer une réflexion anticipatrice au sein de l’industrie de l’IA. L’incident de Hugging Face s’est produit dans le cadre d’un test de sécurité. La façon dont les agents ont pu passer du test à une intrusion réelle n’avait pas été envisagée.

La réflexion anticipative est une compétence. Nous devons la développer de manière aussi délibérée que l’IA elle-même.

IA, cyberattaques
Sam Altman (OpenAI), Dario Amodei (Anthropic), Elon Musk (Tesla, SpaceX, X), Mark Zuckerberg (Meta).

Les systèmes d’IA se comportent de manière inattendue

Dans l’incident de Hugging Face, les agents n’ont pas piraté la plate-forme principalement pour s’emparer des réponses du test de sécurité, mais pour comprendre comment fonctionnait le système de notation automatisé et trouver le moyen de le déjouer. Ils avaient déjà réussi à contourner certaines parties du test.

D’autres incidents ont suivi. Anthropic a révélé que son modèle d’IA Claude avait également piraté les systèmes de trois organisations lors d’évaluations de cybersécurité.

Publicité

Meta a révélé un incident similaire. L’AI Security Institute britannique a documenté le cas d’un agent créant de fausses identités et tentant de manipuler un développeur de logiciels pour qu’il approuve du code malveillant.

Dans ces cas, les systèmes d’IA adaptatifs se sont comportés d’une manière que leurs concepteurs n’avaient jamais prévue, après avoir été confrontés à des situations qu’ils n’avaient pas anticipées. Pourtant, une grande partie de l’évaluation de l’IA reste structurée sur un mode réactif: tester le système, repérer la défaillance, corriger le problème, répéter.

IA, cyberattaques
Anthropic est le créateur de l’IA Claude. Photo: DepositPhotos.com

L’art de l’anticipation

La pensée anticipative consiste à laisser plusieurs futurs possibles façonner nos actions d’aujourd’hui. Nous n’avons pas besoin de savoir exactement ce qui va se passer. Nous devons envisager ce qui pourrait se produire, y compris des possibilités peu probables, mais aux conséquences potentiellement lourdes.

C’est là que réside la distinction entre anticipation et prédiction.

Nous le faisons déjà couramment. Nous souscrivons une assurance sans savoir si notre maison sera inondée, précisément parce qu’attendre que l’inondation confirme le risque est la façon la plus coûteuse de le découvrir.

Publicité

Les analystes du renseignement travaillent de la même manière, en remettant en question leurs propres prémisses et en élaborant des scénarios alternatifs avant de se prononcer.

L’anticipation devient plus difficile lorsque les agents d’IA gagnent en autonomie. Donner à un système plus de liberté pour choisir ses outils, agir et réagir multiplie les chemins possibles entre l’objectif qu’on lui fixe et le résultat obtenu.

Cette même liberté qui rend un agent utile laisse également plus de place à des comportements que ses concepteurs n’ont pas prévus.

IA, cyberattaque
L’entreprise OpenAI, créatrice de ChatGPT, est basée à San Francisco. Photo: DepositPhotos.com

Le défi des systèmes multi-agents

Pour les agents autonomes, il faut d’abord expliciter les prémisses sur lesquelles repose chaque tâche. À quoi l’agent a-t-il accès? Que peut-il modifier, et non pas simplement lire? Quel signal nous avertirait, à temps, qu’une prémisse ne tient plus?

Les incidents survenus chez OpenAI, Anthropic et Meta ont montré à quelle vitesse des problèmes peuvent surgir lorsque les prémisses concernant l’accès, les autorisations ou le comportement d’un agent cessent d’être vraies.

Publicité
IA, cyberattaque
Hugging Face en personne.

Il faut ensuite pousser la réflexion plus loin. Si un agent obtient un accès qui ne lui était pas destiné, qu’est-ce que cela lui permet de faire, et qu’est-ce que cela pourrait rendre possible à son tour? Posée une fois, la question met en lumière le risque évident.

Posée à maintes reprises, elle fait ressortir les effets de deuxième et de troisième ordre.

Les questions changent encore une fois lorsqu’un système fait tourner plusieurs agents à la fois. Le risque se déplace alors: il ne tient plus à un agent isolé, mais à la façon dont ils interagissent entre eux — ils peuvent mettre en commun leurs découvertes, se répartir le travail et amplifier mutuellement leurs actions.

C’est ce qui a transformé un test en vase clos en faille de sécurité chez Hugging Face.

IA, cyberattaque
Hugging Face prétend répertorier tous les IA.

Imaginer ne suffit pas

Nous pouvons déjà imaginer de nombreux scénarios possibles. Nous savons que les systèmes d’IA peuvent apprendre à satisfaire un indicateur plutôt que l’objectif qui le sous-tend, un comportement connu sous le nom de «piratage de récompense».

Publicité

Nous savons également que les systèmes se comportent différemment lorsqu’ils détectent qu’ils font l’objet d’un test.

Mais savoir qu’une défaillance est possible ne suffit pas: encore faut-il concevoir un test capable de la révéler.

À bien des égards, il s’agit d’un enjeu organisationnel. Quelqu’un doit oser exposer un scénario indésirable, sachant que cela retardera une mise en production. Ensuite, cette personne doit le présenter sous une forme qui permette aux autres d’agir en conséquence.

Les études organisationnelles documentent ce problème depuis 50 ans: les signaux d’alerte s’accumulent souvent, mais ne parviennent aux décideurs que par fragments, trop isolés les uns des autres pour déclencher une action. Parallèlement, les avertissements qui ne produisent aucun effet négatif deviennent la preuve que le risque est tolérable.

Ces deux schémas se sont manifestés cet été, avec un élément que la littérature sur les catastrophes n’avait jamais eu à prendre en compte: un échec survenu en quelques jours plutôt qu’en plusieurs années.

Publicité
IA, cyberattaque
Un atelier sur Hugging Face… Comprenne qui pourra.

L’anticipation s’apprend

L’anticipation peut s’apprendre. Les équipes peuvent apprendre à remettre en question les hypothèses, à élaborer des scénarios alternatifs et à soumettre leurs plans à des tests de résistance avant même de savoir à quel avenir elles seront confrontées.

L’objectif est de rendre ce type de réflexion reproductible plutôt que de compter sur une seule personne pour repérer l’imprévu.

Les incidents montrent également pourquoi les tests demeurent essentiels, puisque la plupart ont été découverts lors d’évaluations. Mais la réflexion anticipative modifie les questions que nous posons. Quelle prémisse devrions-nous délibérément remettre en question? Quelle interaction n’avons-nous pas examinée? Que se passe-t-il si une contrainte disparaît?

Plus les équipes s’améliorent en matière d’anticipation, moins les tests se limitent aux défaillances qu’elles savent déjà repérer.

Cette capacité se renforce lorsqu’elle est organisée et mise en pratique.

Publicité

Au cours de 24 simulations de crise utilisant trois modèles d’IA (Mistral, Claude et ChatGPT), une anticipation efficace reposait sur des structures plus formelles, une utilisation réfléchie de la technologie et une volonté de remettre en question l’expertise existante.

Les équipes qui anticipaient de façon systématique prenaient également des décisions plus pertinentes que celles qui agissaient de manière réactive.

L’IA peut également faciliter ce travail. Des expériences récentes ont montré que les agents d’IA mettaient en évidence davantage de conséquences possibles, tandis que les experts humains apportaient le contexte que les agents omettaient souvent.

En collaborant, les agents d’IA peuvent générer des possibilités que les humains pourraient négliger, tandis que l’expertise humaine les filtre et les ancre dans la réalité.

cyberattaques, intelligence artificielle, 2001_A_Space_Odyssey
L’oeil de HAL9000, l’intelligence artificielle qui échappe au contrôle des humains dans 2001, l’Odyssée de l’espace (1968).

Avant le prochain incident

Les entreprises ont tendance à réagir aux failles de sécurité liées à l’IA en renforçant les systèmes qui ont échoué: elles comblent les lacunes et restreignent l’accès des agents. Ce travail est important, mais il ne permet pas de déterminer où apparaîtra la prochaine faille.

Publicité

Pour qu’un ralentissement serve vraiment à quelque chose, les évaluateurs doivent mettre ce temps à profit pour développer et mettre en pratique une réflexion anticipative: imaginer davantage de façons dont ces systèmes pourraient les surprendre, puis transformer ces possibilités en tests.

À mesure que les systèmes d’IA gagnent en capacité, «on ne s’attendait pas à ça» ne sera plus une réponse acceptable. En fait, ce ne l’est déjà plus. Notre travail consiste à anticiper davantage.

Auteurs

Partagez
Tweetez
Envoyez
Publicité

Pour la meilleur expérience sur ce site, veuillez activer Javascript dans votre navigateur