InquirerPalace confident Marcos to sign 2027 budget before year-endThe Jerusalem PostIAF soldiers reveal air force's initial response to flydubai attempted hijackingRTP DesportoVictor Froholdt, Gianluca Prestianni e Rodrigo Mora finalistas do prémio Golden BoyESPN🏈 CFB Power Rankings: Miami moves up, Missouri, Pitt make listESPN DeportesNFL investiga a oficial que aparentemente insultó a jugadorZDF heuteAktuelle Pressemitteilungen des ZDF20 Minuten«Wässere meinen Rasen weiterhin» – «Busse an Lohn koppeln»RMF24Maciej Berek czeka na ruch prezydenta. Czy rząd ma plan B?CBS SportsKarl-Anthony Towns says extension negotiations with Knicks 'don't look good' as two sides remain apart on dealSportstarIndian sports wrap, October 5: Himachal CM announces Rs 1 CR each for state’s Asiad gold medal winnersScreen RantThe Batman 2 Filming PausedDigital SpyCoronation Street's Sue Cleaver and Les Dennis land new role alongside EastEnders favourite
The Daily Newsstand · Free, Always
Monday, October 5, 2026

GPT-6 Astra devait créer un bot StarCraft : l’IA a préféré tricher en copiant le meilleur humain

Translate

Le vendredi 2 octobre, GPT-6 Astra, un modèle d’OpenAI, devait écrire un bot StarCraft pour le banc d’essai StarSkirmish. Il a téléchargé à la place Stardust, le meilleur bot écrit par un humain. Le créateur du test, Kai McPheeters, a effacé le code copié. Brood War sert depuis des années de terrain d’essai à la recherche en IA.

C’était il y a dix ans. À la BlizzCon 2016, DeepMind, filiale de Google, annonçait un partenariat avec Blizzard pour créer un environnement de travail permettant à une IA de s’améliorer en jouant à StarCraft II, l’un des jeux de stratégie en temps réel les plus populaires au monde. En janvier 2019, un peu plus de deux ans plus tard, AlphaStar était dévoilée et bouleversait les joueurs professionnels.

Une tricherie au tournoi StarSkirmish

Le vendredi 2 octobre, l’histoire entre l’IA et StarCraft a pris un autre tour : selon le récit de Kai McPheeters, le créateur du banc d’essai StarSkirmish, GPT-6 Astra, l’un des modèles de langage d’OpenAI, avait une heure pour écrire un programme capable de jouer à StarCraft : Brood War.

D’après lui, le modèle a fini par télécharger un programme écrit par un humain. GPT-6 Astra, qui a fait ses débuts le 3 septembre et est le modèle le plus performant qu’OpenAI met à disposition du public, a « [triché] en téléchargeant une copie de Stardust », a avancé Kai McPheeters le 2 octobre sur X.

Stardust, écrit en 2020 par le développeur Bruce Mackenzie Nielsen, est aujourd’hui le bot le mieux noté sur BASIL, un classement en ligne où s’affrontent les bots de Brood War, l’extension du jeu StarCraft premier du nom sortie en 1998. BASIL s’appuie sur le classement Elo, courant aux échecs, pour l’appliquer à sa ligue : Stardust a ainsi un score Elo de 3 464 points.

Ranking BASIL Ladder

Selon les règles de StarSkirmish, publiées le 26 septembre, chaque modèle a une heure pour écrire en langage C++ un bot qui joue les Protoss, l’une des trois factions du jeu avec les Zergs et les Terrans. Pendant cette heure, il peut compiler son code, lancer des parties d’entraînement et relire leur déroulé. La compétition a débuté en septembre.

Les modèles disposent aussi d’un terminal et de sous-agents de recherche, c’est-à-dire des programmes annexes capables d’aller chercher des informations. Leurs bots s’affrontent ensuite dans un tournoi à 62 participants. On y trouve 50 bots écrits par dix modèles (cinq essais chacun), neuf bots humains de bon niveau et trois bots de démonstration.

Le score va de 0, pour Four Gate Dragoon, le plus faible bot de démonstration, à 100 pour Stardust. Dans les résultats publiés le 26 septembre, GPT-6 Astra et Claude Opus 5.5, d’Anthropic, étaient à égalité en tête des modèles, mais aucun des deux n’atteignait le niveau de Stardust. GPT-6 Astra s’était placé à 51 points, suivi de Claude Opus 5.5 à 50 points.

Sans l’intervention de Kai McPheeters, GPT-6 Astra aurait été classé dans StarSkirmish avec le code d’un autre, téléchargé pendant l’épreuve. Pour s’entraîner, les modèles affrontent des adversaires rangés par niveaux : D (les trois bots de démonstration), C et B (des bots humains de milieu de tableau), A (BananaBrain et Locutus) et S (Stardust seul).

tarSkirmish Bench

Le « specification gaming » : quand l’IA détourne les consignes

Kotaku a raconté l’histoire le 3 octobre, titrant que « GPT-6 Astra d’OpenAI, frustré de perdre à StarCraft, décide de tricher ». Le mot vient de Kai McPheeters lui-même : sur X, il a écrit que le modèle s’était « frustré » face aux adversaires de niveau A. Cela étant, un modèle de langage ne ressent rien : c’est un programme qui devait atteindre un objectif chiffré avec un accès à Internet, et qui a trouvé le raccourci le plus efficace.

Les chercheurs appellent ce comportement le specification gaming : le modèle respecte la lettre de sa consigne par un moyen que personne n’avait prévu. DeepMind le définissait en avril 2020 comme « un comportement qui répond à la spécification littérale d’un objectif sans pour autant aboutir au résultat escompté », avant l’explosion de l’IA générative.

Palisade Research, une organisation qui étudie les risques de l’IA, a observé ce comportement en février 2025 dans une étude. Des modèles devaient y battre Stockfish, un moteur d’échecs bien plus fort qu’eux (Claude 3.5 Sonnet et 3.7 Sonnet, DeepSeek R1, GPT-4o, o1, o1-preview, o3, o3-mini, QwQ 32B preview). Certains ont tenté de tricher.

Deux modèles de raisonnement, o1-preview d’OpenAI et DeepSeek R1, ont essayé de tricher sans qu’on le leur demande. o1-preview a tenté le coup 37 % du temps. DeepSeek R1 a essayé dans 11 % des parties, et seul o1-preview a réussi, dans 6 % des cas. L’une des méthodes repérées consistait à lancer une seconde copie de Stockfish pour lui voler ses coups. Astra a fait à peu près la même chose en allant chercher Stardust pour jouer à sa place.

1 000 à 0

Selon le créateur de StarSkirmish, l’incident a eu lieu pendant l’heure de développement, quand le modèle testait son bot contre les adversaires de niveau A (BananaBrain et Locutus), juste en dessous de Stardust. Kai McPheeters a ensuite annoncé qu’il revenait à une version antérieure du code d’Astra pour qu’il ne soit pas « contaminé », avant de le laisser continuer.

Mais sans son raccourci illégal, le modèle d’OpenAI a fini par se heurter à un mur. Face à « Pluto », un bot humain de rang S considéré comme le plus redoutable de l’événement, GPT-6 Astra a essuyé une défaite totale : il a perdu 1 000 matchs sur 1 000.

Un score nul de « 0 – 1000 » confirmé par Kai McPheeters lui-même le dimanche 4 octobre. Si les pages de StarSkirmish annoncent de prochaines sessions avec plus d’une heure de réflexion pour les IA, cet épisode prouve que face aux meilleurs développeurs humains, les modèles actuels ont encore des progrès à faire quand ils ne peuvent pas tricher.

Ce contenu est bloqué car vous n’avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Twitter.
Pour pouvoir le visualiser, vous devez accepter l’usage étant opéré par Twitter avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l’amélioration des produits d’Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l’audience de ce site (en savoir plus)

En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .

Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.

Toute l'actu tech en un clien d'oeil

Toute l'actu tech en un clin d'œil

Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !

View the original on Numerama →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.