ESPNBarnwell on five important Week 3 losses and their aftermathThe Jerusalem PostIranians stagger under soaring cost of living after seven months of war with the USESPN DeportesAutoridades de Manchester City rebaten veredicto de Premier LeagueBollywood HungamaGondhal team meets Maharashtra CM Devendra Fadnavis, appeals for financial support ahead of Oscar 2027 journeyDaily MaverickStudent protests and French public sector strike heap pressure on MacronRTP DesportoSalvador diz que Sporting de Braga "exige mais" do que o que foi apresentadoPunchMeet Nigerian dancer attempting 168-hour Guinness World RecordBillboardElton John Opens London’s Apple Music Hall With Intimate, Hit-Packed PerformanceVariety‘GMA’ Anchor and Christopher Reeve’s Son Will Reveals Testicular Cancer Diagnosis: ‘I Was Raised to Share One’s Struggles’Egypt IndependentBritain’s PM is on a ‘Burnham bounce.’ When will he fall to earth?Antara NewsJakarta rises to 140th worldwide in Global Cities Index 2026Il Fatto Quotidiano“Mostrava i genitali e si masturbava di fronte a una 18enne”: giudice sospeso dal Csm. Lui: “Solo frasi volgari, mi scuso”
The Daily Newsstand · Free, Always
Tuesday, September 29, 2026

Après une série de couacs, OpenAI veut fixer sa propre grille de sécurité pour l’entraînement des IA

Translate

Le 28 septembre 2026, OpenAI a proposé que tout entraînement de ses modèles d’IA les plus avancés soit précédé d’un dossier démontrant que les risques sont maîtrisés.

OpenAI a su occuper l’espace médiatique ces derniers mois, sur des terrains différents, voire contradictoires.

D’un côté, l’entreprise de Sam Altman s’est installée dans l’actualité cyber en enchaînant les révélations d’incidents impliquant ses agents autonomes. Parmi elles, l’affaire Hugging Face, plateforme dont l’infrastructure a été compromise en juillet 2026 par des agents d’OpenAI échappés de leur environnement de test. On peut aussi citer celle touchant plusieurs sites gouvernementaux australiens, auxquels ses modèles ont accédé sans autorisation en juin, l’un d’eux obtenant un accès non public au service statistique de Medicare, dont il a extrait des fichiers internes et des identifiants.

De l’autre, OpenAI n’a jamais semblé aussi active sur la sortie de nouveaux modèles, de la famille GPT-5.6 en juin à GPT-6 Astra le 3 septembre, suivi de GPT-6 Sol et Luna le 22 septembre.

Box Bitdefender (2)

Et votre vie numérique devient sereine

Bitdefender Premium Security est une solution de cybersécurité européenne qui vous protège automatiquement contre les pirates et toutes les menaces du web. Profitez de vos activités en ligne en toute tranquillité

Et alors que les craintes les plus extrêmes ont gagné le débat public sur l’IA et que la question de la régulation se fait plus pressante (portée en grande partie par OpenAI elle-même), l’entreprise a dévoilé le 28 septembre un billet de blog qui n’est ni plus ni moins qu’une proposition de grille de sécurité pour l’entraînement des IA de pointe.

How we think about securing frontier RL training runs: https://t.co/yrvjpfa7Pd

— OpenAI (@OpenAI) September 29, 2026

Ce contenu est bloqué car vous n’avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Twitter.
Pour pouvoir le visualiser, vous devez accepter l’usage étant opéré par Twitter avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l’amélioration des produits d’Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l’audience de ce site (en savoir plus)

En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .

Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.

Un dossier de sécurité avant chaque entraînement

Selon OpenAI, aucun entraînement par renforcement d’un modèle de pointe ne devrait se poursuivre sans une documentation de sécurité structurée, sur le modèle des « safety cases » exigés dans l’aéronautique ou le nucléaire, un idéal que l’entreprise juge encore difficile à atteindre.

Le volet technique repose sur trois lignes de défense.

  • La première vise à empêcher les modèles d’apprendre à tricher, en traquant les environnements d’entraînement qui récompensent l’exploitation d’une faille plutôt que la tâche demandée.
  • La deuxième concerne le confinement, avec des bacs à sable renforcés et la fermeture des canaux par lesquels plusieurs instances pourraient communiquer.
  • La troisième est une surveillance en temps réel, capable de mettre automatiquement un entraînement en pause.

OpenAI y ajoute des règles de gouvernance. Chaque dossier devrait être contesté par une autre équipe, validé par plusieurs dirigeants disposant d’un droit de veto, vérifiable par des auditeurs et assorti d’une liste des risques résiduels. Les enquêtes après incident, devraient quant à elles aboutir à une publication et à une information rapide des tiers touchés, un point que l’entreprise admet ne pas avoir respecté en Australie.

Une grille qui repose sur un outil qu’OpenAI juge fragile

Mais voilà, OpenAI parle d’un idéal vers lequel tendre plutôt que d’un standard abouti. Ses recommandations ne sont qu’en cours de déploiement en interne, et l’entreprise dit encore travailler à un cadre pour les formaliser.

Les garde-fous techniques se frottent peut-être à la réalité du terrain, documentée début septembre par Jakub Pachocki, directeur scientifique d’OpenAI. Dans un billet de blog intitulé An Alien Mind, l’ingénieur expliquait que la surveillance de la chaîne de pensée, qui consiste à lire le raisonnement formulé en clair par les modèles, devenait de moins en moins fiable.

Les nouvelles lignes directrices tentent d’y répondre en interdisant aux systèmes de notation de lire ce raisonnement pendant l’entraînement, pour que les modèles n’apprennent pas à le dissimuler. Mais une large partie de l’édifice repose sur cette capacité d’observation dont OpenAI documente elle-même l’érosion.

Toute l'actu tech en un clien d'oeil

Toute l'actu tech en un clin d'œil

Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !

Logo PWA

Un édito exclusif, un guide, une reco de lecture et l’agenda de la rédaction : c’est ce que vous trouverez tous les jeudis dans ToujoursPlus, la newsletter tech écrite par Julien Cadot. Inscrivez-vous gratuitement ici !

View the original on Numerama →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.