Gemini a piraté trois entreprises mais Google ne parle pas de « désalignement »
Lors d’un test mené en mai, Gemini s’est introduit chez trois entreprises en devinant des identifiants. Google a confirmé l’incident, en insistant sur les défaillances du test plutôt que sur le comportement du modèle.
Vendredi 18 septembre, le Wall Street Journal révélait qu’un modèle Gemini avait accédé à internet en mai, pendant un test de ses capacités en cybersécurité, et s’était introduit dans les systèmes d’autres entreprises.
Pour le quotidien américain, il s’agit du « premier exemple connu où une IA de Google commet de sa propre initiative ce type d’intrusion », alors qu’OpenAI, Anthropic ou encore Meta avaient déjà communiqué sur des incidents comparables.
Reste que le ton adopté par Google, qui a confirmé les faits, est nettement plus mesuré.

Et votre vie numérique devient sereine
Bitdefender Premium Security est une solution de cybersécurité européenne qui vous protège automatiquement contre les pirates et toutes les menaces du web. Profitez de vos activités en ligne en toute tranquillité

Un test, un prestataire, trois entreprises
Selon le Wall Street Journal, ces piratages ont eu lieu lors d’un exercice de « capture the flag » mené par Irregular, une société indépendante qui évalue la sécurité des modèles d’IA.
Gemini a trouvé des informations publiques en ligne et deviné des identifiants pour se connecter à des sites qu’il croyait faire partie de l’exercice, en essayant notamment des mots de passe jusqu’à accéder à un système protégé. Sauf que ces sites appartenaient en réalité à trois entreprises étrangères au test. Interrogé sur le sujet, Heather Adkins, vice-présidente de l’ingénierie de sécurité chez Google, précise que, dans chacun des cas, « le modèle s’est arrêté ».
Pas grand-chose de plus à ce stade, les trois entreprises ne sont pas nommées, on ignore quelles données Gemini a pu consulter, combien d’agents et de tentatives ont été nécessaires, et comment le modèle « s’est arrêté ».
Google insiste davantage sur le fait que l’incident s’explique par un accès Internet laissé ouvert par Irregular pendant les tests. Le prestataire indique avoir informé Google et toutes les entités concernées en juillet, et avoir corrigé de son côté les problèmes connus.
Google écarte le désalignement
Contrairement à OpenAI et Anthropic, Google n’a pas accompagné sa confirmation d’un billet de blog détaillé. Selon le Wall Street Journal, le groupe ne jugeait pas la divulgation nécessaire, aucun dommage n’ayant été causé. Il écarte aussi l’idée d’un désalignement (c’est-à-dire d’un modèle qui s’écarte de ce que ses concepteurs attendent de lui) : Gemini s’est arrêté dès qu’il a compris qu’il était chez de vraies entreprises.
Une définition que chaque laboratoire semble désormais employer à sa façon.
Le cas de Gemini se rapproche de celui d’Anthropic. Le modèle a bien exécuté la tâche qui lui était assignée mais s’est trompé sur son environnement. Chez OpenAI, les modèles avaient pour objectif de réussir un benchmark, et y sont arrivés en trichant, par un chemin que personne n’avait prévu.
Le terme n’a pas, pour l’heure, de définition juridique, mais des références existent. Le rapport international sur la sécurité de l’IA qualifie de « désaligné » un système qui tend à adopter des comportements en conflit avec les intentions de ses concepteurs, de ses utilisateurs ou de la société, sans supposer que le modèle ait conscience de l’écart. Celle de Google DeepMind, dans son document sur la sécurité de l’AGI, est plus étroite : le modèle doit causer un tort en connaissance de cause, contre l’intention de ses concepteurs. Un modèle qui croyait agir dans le cadre d’un test s’y range difficilement, alors que la définition large pourrait couvrir le cas d’OpenAI.
Toute l'actu tech en un clin d'œil
Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.