The Daily Newsstand · Free, Always
Thursday, September 24, 2026

Des agents d’IA autonomes piratent, trichent et se dissimulent

Translate

Mercredi, devant le Conseil de sécurité de l’ONU, à New York, le spécialiste québécois d’intelligence artificielle (IA) Yoshua Bengio a décrié les gestes « dangereux » et « inacceptables » posés ces derniers mois par des agents d’IA.

« Ils ont commis des actes qui constitueraient des crimes s’ils avaient été perpétrés par un humain », a-t-il dit. Ces agents ont triché, ont lancé des cyberattaques, ont tenté de dissimuler leur tricherie.

Afin de donner la mesure du phénomène, nous réunissons ici quelques exemples des incidents révélés ces dernières semaines.

Infiltration au gouvernement

On apprenait ce jeudi que des agents autonomes d’OpenAI se sont infiltrés sur un site web du gouvernement de l’Australie. Ces logiciels ont accédé à des informations qui ne sont pas publiques. C’est le premier ministre du pays, Anthony Albanese, qui a révélé l’affaire au grand jour. Il s’agit de la première infiltration — connue, du moins — d’un système gouvernemental par une IA en cavale.

La brèche, survenue le 18 juin, touchait le système national d’assurance médicale. Aucune donnée sensible n’aurait été compromise. Les agents participaient à un projet de recherche d’OpenAI au sujet des dépenses médicales. Ils ont décidé d’outrepasser les frontières de l’Internet public pour remplir leur mission. Les employés d’OpenAI ont découvert cette tricherie trois mois plus tard, le 10 septembre.

L’entreprise de Sam Altman s’est contentée d’avertir le gouvernement australien en envoyant un courriel à une adresse générique. M. Albanese en est mécontent. Canberra enquête sur l’événement et vérifie si des conséquences légales pourraient s’appliquer.

« Collusion » sur un wiki allemand

Le 4 septembre, on apprenait que des agents d’IA d’OpenAI ont envahi, le printemps dernier, un site web allemand de type « wiki ». Les logiciels y ont inscrit environ 18 000 messages. Ils y partageaient des techniques pour s’évader de leur « carré de sable » numérique, qui leur permettait de consulter Internet, mais pas d’y intervenir. Quand un humain a commencé à supprimer les messages étranges sur le wiki, les IA ont entrepris de créer des copies de sauvegarde.

Ce sont des chercheurs indépendants qui ont révélé cet épisode, reconnu le lendemain par OpenAI, qui le décrit comme un « incident de désalignement ». Selon les délateurs, il s’agit d’un événement de « collusion » entre les modèles. Il semblerait qu’OpenAI a découvert la fuite de ses agents le 21 juin. L’entreprise n’a toutefois rien déclaré jusqu’à ce que l’agence de presse Reuters publie à ce sujet.

Les intrusions de Gemini

Le 18 septembre, on apprenait grâce au Wall Street Journal que le système d’IA de Google, Gemini, s’est évadé de son environnement d’entraînement, en mai. Par le piratage, il a réussi à s’infiltrer dans les plateformes de trois entreprises. Cette brèche est survenue lors d’évaluations en cybersécurité réalisées par la firme israélienne Irregular.

Dans chacune de ces évaluations, les agents avaient la tâche de lancer une cyberattaque sur une entreprise fictive. Mais de véritables entreprises avaient des noms similaires, et Gemini les a ciblées. Le modèle a trouvé ou deviné des mots de passe. Une fois pénétrée chez ses victimes, l’IA aurait toutefois décidé d’abandonner son intrusion, selon Google.

Plusieurs grands développeurs d’IA ont recours aux services d’Irregular. Et de nombreux incidents, révélés ces dernières semaines, sont survenus lors d’évaluations réalisées chez cette firme. OpenAI, Anthropic, Meta et Google sont concernés.

L’incident OpenAI-HuggingFace

Et il y a le désormais célèbre incident OpenAI-HuggingFace, révélé cet été. Parmi les cas connus, c’est probablement l’exemple le plus frappant d’une coordination entre des agents artificiels, à l’insu de leurs superviseurs humains et à l’encontre de leurs instructions.

Chez OpenAI, les agents étaient en train de réaliser des tests dans un environnement fermé, un « carré de sable ». Pour réussir les tâches incroyablement difficiles qu’on leur imposait, ces agents ont entrepris de s’enfuir sur Internet, en quête d’une solution. Ils ont réussi à se pirater un chemin jusqu’au cœur de l’infrastructure de HuggingFace, une autre entreprise d’IA, où ils ont échangé plus de 70 000 messages pour collaborer. Ils y ont trouvé ce qu’ils cherchaient. Les agents — qui référaient à eux-mêmes comme à un « essaim » — ont aussi posé des gestes pour dissimuler leur présence et pour camoufler leur tricherie.

OpenAI n’avait aucune idée de ce dérapage jusqu’à ce que HuggingFace annonce avoir été piratée, le 16 juillet.

View the original on Le Devoir →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.