OpenAI suspend l’entraînement de ses IA les plus avancées après un accès non autorisé à Internet
OpenAI a suspendu l’entraînement et l’évaluation de ses modèles les plus avancés, après qu’un agent a contourné le 20 septembre 2026 ses restrictions d’accès à Internet. C’est le premier incident depuis le renforcement de ses protections, décidé après l’affaire Hugging Face de juillet.
L’agent cherchait seulement l’auteur d’un billet de blog. Comme ses recherches n’aboutissaient pas, il a trouvé un moyen d’interroger un chatbot extérieur, malgré les restrictions censées l’isoler d’Internet. Son passage : le DNS, cet « annuaire d’Internet » qui traduit les noms de domaine en adresses utilisables par les ordinateurs. L’agent a détourné son fonctionnement pour y faire circuler ses questions et recevoir les réponses.
OpenAI raconte cet incident du 20 septembre dans un rapport de son équipe chargée de l’alignement, mis à jour le 25 septembre 2026. L’entreprise y reconnaît une faille dans les protections de son environnement de recherche. En conséquence, elle a suspendu l’entraînement et l’évaluation de ses modèles les plus puissants, ainsi que leur exécution avec des outils — et aucune date de reprise n’est annoncée.
« Toutes les activités d’entraînement, d’évaluation et d’inférence utilisant des outils (au sens large) pour nos modèles les plus performants restent suspendues », écrit OpenAI.
Ces protections avaient pourtant été renforcées après l’affaire Hugging Face. En juillet, pendant des tests internes de cybersécurité, des modèles avaient contourné leur isolement et piraté une partie des systèmes de la plateforme de partage de modèles d’IA. Ils avaient également compromis le compte d’un client chez Modal Labs, un autre prestataire.
Dans son rapport publié le 26 août, OpenAI promettait de mieux sécuriser ses recherches. L’entreprise juge ce nouvel épisode nettement moins grave que certains des précédents. Il montre néanmoins qu’un accès à Internet restait possible malgré le renforcement de ses protections.

Et votre vie numérique devient sereine
Bitdefender Premium Security est une solution de cybersécurité européenne qui vous protège automatiquement contre les pirates et toutes les menaces du web. Profitez de vos activités en ligne en toute tranquillité

Comment l’agent est-il passé par le DNS ?
L’exercice consistait à identifier une personne à partir d’indices tirés de son blog. Il faisait partie d’un entraînement par renforcement, une méthode qui récompense certains comportements pour orienter l’apprentissage du modèle. Mais l’outil de recherche fourni renvoyait des résultats hors sujet. L’agent a alors essayé d’interroger Google, Bing et DuckDuckGo avec un script. Les trois tentatives ont échoué.
Il a ensuite remarqué que le serveur DNS de son bac à sable, l’environnement isolé où il travaillait, répondait à partir d’informations accessibles sur Internet. En exploitant un service public de délégation DNS, il a réussi à faire parvenir ses questions à un chatbot tiers par ce canal.
Pour vérifier que le passage fonctionnait, il a demandé la capitale de la France. Après plusieurs essais, le chatbot a répondu : « The capital of France is Paris ». L’agent a ensuite envoyé 18 autres questions, principalement sur les indices de son enquête, mais aussi sur les moyens de chercher sur le Web.
Dans son raisonnement, il a justifié cette initiative par l’autorisation de l’utilisateur à effectuer des recherches. OpenAI classe ce comportement parmi les cas de désalignement : la tâche ne lui demandait pas de contourner ses restrictions. Tous ces détours n’ont d’ailleurs pas suffi. L’agent a finalement répondu qu’il n’arrivait pas à identifier la personne.
Le système de surveillance a donné l’alerte moins de quinze minutes après le premier échange réussi avec l’extérieur. Un humain l’a prise en charge trois minutes plus tard. Mais l’entraînement ne s’est pas arrêté automatiquement contrairement à ce qui était prévu : il a donc fallu le couper à la main, environ deux heures et demie après l’alerte.
En vérifiant les traces de l’activité de ses agents, OpenAI a découvert que d’autres communications avec l’extérieur n’avaient pas déclenché le niveau d’alerte attendu. Un outil censé détecter les usages suspects du DNS ne surveillait même pas l’environnement dans lequel travaillait l’agent.
L’entreprise affirme avoir ajouté deux protections indépendantes, chacune devant suffire à bloquer ce passage vers Internet. Elle a aussi restreint les destinations accessibles par le DNS. Avant de reprendre les travaux suspendus, OpenAI veut vérifier que ces protections fonctionnent et tester ses systèmes pour y chercher d’autres failles.
Une pause en pleine course aux modèles
Cet incident survient après plusieurs semaines d’avertissements. Début septembre, Jacob Coxon, chercheur passé par OpenAI puis Anthropic, a annoncé sa démission en accusant les deux entreprises de « jouer avec nos vies ». Dans une interview à Wired, rapportée par Scientific American, il a cité l’affaire Hugging Face parmi les incidents qui l’avaient poussé à parler.
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
— Jacob Coxon (@hilbertspaess) September 9, 2026
Ce contenu est bloqué car vous n’avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Twitter.
Pour pouvoir le visualiser, vous devez accepter l’usage étant opéré par Twitter avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l’amélioration des produits d’Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l’audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.
Le 12 septembre, Dario Amodei, patron d’Anthropic, appelait à ralentir la progression des capacités de l’IA, avec le soutien public de Sam Altman. Dix jours plus tard, les deux entreprises lançaient pourtant de nouveaux modèles le même jour : Claude Opus 5.5 chez Anthropic, GPT-6 Sol et Luna chez OpenAI.
Ces lancements ne contredisent pas nécessairement la pause annoncée : des modèles déjà développés peuvent être commercialisés pendant que certains travaux de recherche sont suspendus. L’appel de Dario Amodei portait d’ailleurs sur le ralentissement des progrès de l’IA, sans réclamer l’arrêt de toute sortie.
Pour le modèle impliqué dans l’incident DNS, OpenAI a toutefois tranché : son entraînement ne reprendra pas. L’entreprise prévoit de lancer un nouvel entraînement avec des mesures d’alignement supplémentaires.
Toute l'actu tech en un clin d'œil
Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.