PunchNDLEA intercepts N3.4bn drugs, arrests fake cop, mechanicDaily MaverickSOCCER: Ahead of the game: How Safa chief Danny Jordaan keeps iron grip on powerInquirerPeñafrancia procession in Naga draws 1.2 million, ends peacefullyThe Jerusalem PostEl-Sayed visits Jewish Michiganders for Rosh Hashanah meal after accusations of antisemitismוואלהרצח ושיבוש הליכי משפט: כתב אישום נגד שני תושבי מזרח ירושליםCNN Türk‘Daha 17’ benim için aile demek’Antara NewsTNI Chief urges inter-agency collaboration to address Papua conflict경향신문‘팔레스타인 해방’ 논란에 입 연 에드 시런 “가자지구 상황은 재앙”Wirtualna PolskaWojna z NATO to wyrok dla Putina? Słowa Sikorskiego pod lupąInteriaRekordowa wygrana w Lotto. Bajońska suma trafi na konto zwycięzcySportstarAsian Games LIVE, September 20: India wins two silver in shooting; India reaches women's cricket final; India beats Singapore in table tennis — Latest scores and newsRai NewsFenix, a Roma la premier Meloni ai giovani di Fratelli d'Italia: "Immensamente fiera di voi"
The Daily Newsstand · Free, Always
Sunday, September 20, 2026

Ils ont remplacé les employés d’une entreprise par des IA : le résultat est sans appel

Translate

L'intelligence artificielle est-elle sur le point de nous voler notre travail à tous ? Certaines boîtes n'hésitent pas à parier dessus, tandis que d'autres ne veulent rien savoir, la jugeant incapable. Mais qu'en est-il vraiment ? Dans un article en prépublication sur Arxiv, des chercheurs de l'université Carnegie Mellon ont simulé une entreprise et engagé des agents d'intelligence artificielle pour la faire tourner. Et le résultat était loin d'être positif.

Des IA qui ne sont pas vraiment aussi fortes qu’il semble. © SB, Grok

Il a licencié ses employés pour les remplacer par de l’IA : vous allez voir comment ça s’est terminé

Non, les IA ne sont pas prêtes à nous mettre au chômage. Du moins pas encore… Après avoir misé sur les IA au lieu des humains durant deux ans, un patron de la Fintech le regrette amèrement.... Lire la suite

Les employés virtuels étaient des agents basés sur Claude d'Anthropic, GPT-4o d'OpenAI, Google Gemini, Amazon Nova, Meta Llama, et Qwen d'Alibaba. Ils se sont vu attribuer différents postes, comme analyste financier, chef de projet ou encore ingénieur logiciel. En même temps, les chercheurs ont utilisé une autre plateforme pour simuler des collègues qu'ils devaient contacter pour certaines tâches, comme un département des relations humaines.

Les agents ont échoué à plus de trois quarts des tâches

Les agents ont reçu différentes tâches, comme naviguer parmi différents fichiers pour analyser une base de données, ou encore effectuer plusieurs visites virtuelles pour choisir de nouveaux locaux. Claude 3.5 Sonnet a fini largement en tête, mais cet agent n'a réussi à terminer que 24 % des tâches. Même en prenant en compte les tâches partiellement complétées, son score n'arrive qu'à 34,4 %.

Gemini 2.0 Flash se trouve en seconde position, mais n'est parvenu à compléter que 11,4 % des tâches. Aucun autre agent n'a dépassé 10 %. Toutefois, en matière de coût de fonctionnement, Claude 3.5 Sonnet a coûté 6,34 dollars, contre seulement 0,79 dollars pour Gemini 2.0 Flash.

Des chercheurs ont modélisé 8,3 milliards d’individus pour le meilleur ou pour le pire. Illustration créée à l'aide d'un outil IA. © Xavier Demeersman, ChatGPT

Des chercheurs ont créé 8,3 milliards de faux humains… et les entreprises peuvent les tester !

Une équipe scientifique vient de dévoiler MatrAIx, une infrastructure open source capable de simuler 8,3 milliards d’individualités virtuelles. Cette modélisation est essentiellement tournée vers le business, car le jumeau numérique de la population mondiale promet de révolutionner le test de produits, l’économie et la recherche en sciences sociales.... Lire la suite

Les chercheurs ont indiqué que bien souvent les agents ne sont pas capables de comprendre la partie implicite des instructions, comme lorsqu'ils doivent écrire le résultat dans un fichier avec une extension « .docx », ils n'en déduisent pas qu'il s'agit d'un format Microsoft Word. Ils échouent à certaines tâches par manque de compétences sociales.

Mais l'un des plus gros problèmes était lorsqu'ils doivent naviguer sur le Web, et notamment la possibilité de naviguer dans les popups. Et parfois, lorsqu'ils sont perdus, ils font des raccourcis afin d'omettre la partie difficile de la tâche et pensent avoir réussi. Ces résultats montrent que même si les IA peuvent donner d'excellents résultats sur certaines tâches bien spécifiques, ils sont encore loin d'être capables d'un fonctionnement autonome.

View the original on Futura Sciences

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.