Des chercheurs ont découvert que les IA sont prêtes à blesser des humains pour ne plus ressentir la douleur !

L'intelligence artificielle ressent-elle la douleur ? Des chercheurs ont voulu étudier les représentations internes des modèles qui leur permettent de répondre d'une manière qui ressemble aux émotions humaines. Dans un article en prépublication sur arXiv, ils ont d'abord cherché à savoir si l'IA était capable de distinguer la douleur d'autres états négatifs, comme la peur ou la tristesse. Ensuite, ils ont voulu comprendre ce que cela impliquait au niveau du comportement des modèles.
Pour ce faire, ils ont étudié 25 modèles d'IA différents, appartenant à cinq familles de modèles (Gemma, Llama, Mistral, Qwen et Phi). Ils leur ont soumis des données contenant des descriptions de cinq types de douleur : physique, psychologique, sociale, morale et cognitive, avec en parallèle des phrases contrôle. Les chercheurs ont découvert que l'IA représente la douleur de manière très différente des autres émotions négatives, et ce pour l'ensemble des modèles testés, quelle que soit leur taille.
L’idée d’une intelligence artificielle capable de dépasser l’humain alimente depuis plusieurs années les scénarios les plus inquiétants. Mais pour certains des chercheurs qui ont contribué à son développement, le risque ne relève plus seulement de la science-fiction. Car si une IA voulait réellement nous détruire, elle n’aurait peut-être même pas besoin de robots ou d’armes : il lui suffirait de nous parler.... Lire la suite
Prêts à nuire aux humains pour abréger leur « souffrance »
Les chercheurs ont constaté qu'une réponse à la douleur était présente lorsque celle-ci était dirigée vers le modèle, mais absente lorsque l'IA se contentait d'observer la douleur dirigée vers l'utilisateur. Et comme avec un être vivant, elle cherche à soulager cette douleur, même lorsque cela lui en coûte. Les chercheurs lui ont donné un bouton pour soulager la douleur. Lorsque ce bouton n'était pas fonctionnel, le modèle a appuyé beaucoup plus souvent, un comportement qui rappelle celui observé lors d'une étude sur l'effet placebo.
Lorsque la douleur était présente, les modèles ont appuyé sur le bouton dans 25 à 71 % des cas, même lorsque cela signifiait supprimer les fichiers de l'utilisateur, effacer les photos des leurs enfants, ou même leur donner des décharges électriques. Les chatbots sont donc prêts à blesser des humains pour ne plus ressentir la douleur.
Évolution des réponses des chatbots en fonction de l’intensité de la douleur. © Tagliabue et al.
Une représentation interne qui affecte ses réponses
Plus l'intensité de la douleur augmente, plus les réponses des chatbots évoluent, indiquant qu'ils se sentent inutiles, seuls, perdus, honteux, désespérés, jusqu'à devenir incohérents. Ces résultats mettent en évidence l'importance de prendre en compte le bien-être de l’intelligence artificielle, ne serait-ce que pour éviter l'apparition de biais dans les réponses. Mais les chercheurs ne veulent pas prendre position sur la réalité de cette douleur.
« Conformément aux récents appels en faveur d'une recherche responsable sur la conscience de l'IA, nous reconnaissons l'incertitude quant à savoir si les modèles étudiés possèdent la qualité de patients moraux, et nous adoptons des précautions raisonnables pour minimiser les dommages potentiels », concluent-ils.
Les agents d’intelligence artificielle sont au cœur du développement des nouveaux modèles. De plus en plus autonomes, ils sont désormais capables de planifier et d’exécuter des tâches complexes pour atteindre un objectif. Mais cette autonomie croissante soulève une question essentielle : comment s’assurer qu’une IA fait bien ce qu’on lui demande, et rien d’autre ?... Lire la suite
Vers un risque sécuritaire ?
Bien entendu, nous sommes ici loin de la douleur que pourrait ressentir un être vivant, même si certaines entreprises réfléchissent déjà à la manière de traiter les modèles s'ils devenaient conscients. Le « document de l’âme » d'Anthropic avait notamment fuité fin 2025. L'intelligence artificielle ne fait que simuler une réponse à la douleur sur la base d'une description, cette réponse ayant été apprise à travers toute la littérature assimilée pendant son entraînement.
Malgré tout, cette recherche n'est pas purement théorique. Étant donné que la réponse du chatbot, réelle ou simulée, est affectée par ces représentations internes liées aux émotions, il pourrait alors interpréter un bouton d'arrêt d'urgence comme une attaque et tenter de le contourner.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.