Après une série de couacs, OpenAI veut fixer sa propre grille de sécurité pour l’entraînement des IA
Le 28 septembre 2026, OpenAI a proposé que tout entraînement de ses modèles d’IA les plus avancés soit précédé d’un dossier démontrant que les risques sont maîtrisés.
OpenAI a su occuper l’espace médiatique ces derniers mois, sur des terrains différents, voire contradictoires.
D’un côté, l’entreprise de Sam Altman s’est installée dans l’actualité cyber en enchaînant les révélations d’incidents impliquant ses agents autonomes. Parmi elles, l’affaire Hugging Face, plateforme dont l’infrastructure a été compromise en juillet 2026 par des agents d’OpenAI échappés de leur environnement de test. On peut aussi citer celle touchant plusieurs sites gouvernementaux australiens, auxquels ses modèles ont accédé sans autorisation en juin, l’un d’eux obtenant un accès non public au service statistique de Medicare, dont il a extrait des fichiers internes et des identifiants.
De l’autre, OpenAI n’a jamais semblé aussi active sur la sortie de nouveaux modèles, de la famille GPT-5.6 en juin à GPT-6 Astra le 3 septembre, suivi de GPT-6 Sol et Luna le 22 septembre.

Et votre vie numérique devient sereine
Bitdefender Premium Security est une solution de cybersécurité européenne qui vous protège automatiquement contre les pirates et toutes les menaces du web. Profitez de vos activités en ligne en toute tranquillité
Et alors que les craintes les plus extrêmes ont gagné le débat public sur l’IA et que la question de la régulation se fait plus pressante (portée en grande partie par OpenAI elle-même), l’entreprise a dévoilé le 28 septembre un billet de blog qui n’est ni plus ni moins qu’une proposition de grille de sécurité pour l’entraînement des IA de pointe.
How we think about securing frontier RL training runs: https://t.co/yrvjpfa7Pd
— OpenAI (@OpenAI) September 29, 2026
Ce contenu est bloqué car vous n’avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Twitter.
Pour pouvoir le visualiser, vous devez accepter l’usage étant opéré par Twitter avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l’amélioration des produits d’Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l’audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.
Un dossier de sécurité avant chaque entraînement
Selon OpenAI, aucun entraînement par renforcement d’un modèle de pointe ne devrait se poursuivre sans une documentation de sécurité structurée, sur le modèle des « safety cases » exigés dans l’aéronautique ou le nucléaire, un idéal que l’entreprise juge encore difficile à atteindre.
Le volet technique repose sur trois lignes de défense.
- La première vise à empêcher les modèles d’apprendre à tricher, en traquant les environnements d’entraînement qui récompensent l’exploitation d’une faille plutôt que la tâche demandée.
- La deuxième concerne le confinement, avec des bacs à sable renforcés et la fermeture des canaux par lesquels plusieurs instances pourraient communiquer.
- La troisième est une surveillance en temps réel, capable de mettre automatiquement un entraînement en pause.
OpenAI y ajoute des règles de gouvernance. Chaque dossier devrait être contesté par une autre équipe, validé par plusieurs dirigeants disposant d’un droit de veto, vérifiable par des auditeurs et assorti d’une liste des risques résiduels. Les enquêtes après incident, devraient quant à elles aboutir à une publication et à une information rapide des tiers touchés, un point que l’entreprise admet ne pas avoir respecté en Australie.
Une grille qui repose sur un outil qu’OpenAI juge fragile
Mais voilà, OpenAI parle d’un idéal vers lequel tendre plutôt que d’un standard abouti. Ses recommandations ne sont qu’en cours de déploiement en interne, et l’entreprise dit encore travailler à un cadre pour les formaliser.
Les garde-fous techniques se frottent peut-être à la réalité du terrain, documentée début septembre par Jakub Pachocki, directeur scientifique d’OpenAI. Dans un billet de blog intitulé An Alien Mind, l’ingénieur expliquait que la surveillance de la chaîne de pensée, qui consiste à lire le raisonnement formulé en clair par les modèles, devenait de moins en moins fiable.
Les nouvelles lignes directrices tentent d’y répondre en interdisant aux systèmes de notation de lire ce raisonnement pendant l’entraînement, pour que les modèles n’apprennent pas à le dissimuler. Mais une large partie de l’édifice repose sur cette capacité d’observation dont OpenAI documente elle-même l’érosion.
Toute l'actu tech en un clin d'œil
Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !
Un édito exclusif, un guide, une reco de lecture et l’agenda de la rédaction : c’est ce que vous trouverez tous les jeudis dans ToujoursPlus, la newsletter tech écrite par Julien Cadot. Inscrivez-vous gratuitement ici !
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.