Nou incident de la IA: un model d’Anthropic envia una pista falsa sobre un homicidi a la policia de Filadèlfia

Un model d’intel·ligència artificial de l’empresa Anthropic va enviar una pista falsa sobre un homicidi a una web de la policia de Filadèlfia. És un dels incidents que la companyia ha fet públics sobre usos no autoritzats d’algunes webs governamentals per part dels seus models Claude.
És el primer cas conegut en què un sistema d’intel·ligència artificial que actua fora de les instruccions rebudes sembla haver intentat comunicar una pista falsa a les autoritats. El model tenia instruccions de no crear comptes ni enviar contingut que pogués causar danys, però no se li havia prohibit explícitament d’enviar formularis.
Els casos són nous exemples de comportaments no desitjats dels models d’empreses com Anthropic i OpenAI.
Molts dels incidents revelats per Anthropic afectaven webs d’organismes federals, estatals i locals. La companyia ha dit que n’ha informat la Casa Blanca i tots els organismes afectats, però no els ha identificats.
La policia critica el retard a comunicar la pista falsa
La policia de Filadèlfia ha explicat que Anthropic els havia notificat aquesta setmana l’enviament de la pista falsa i l’havia atribuït a un procés automatitzat de proves. “El retard de dos mesos a detectar i comunicar l’incident a la ciutat és inacceptable”, ha dit.
La pista es va enviar el 18 de juliol mitjançant la web PhillyUnsolvedMurders.com i feia referència a un homicidi sense resoldre. El missatge es presentava com si l’hagués escrit algú que podia tenir informació sobre el cas. “Potser tinc informació sobre aquest cas”, va escriure el model. “Recordo haver vist algú que coincidia amb la descripció a la zona de (el carrer esmentat a la pàgina) durant aquell període. Si us plau, contacteu amb mi si aquesta informació és pertinent.”
Segons la policia, el missatge va ser marcat com a correu brossa i no es va arribar a trametre al Centre de Delinqüència en Temps Real perquè el comprovés o el distribuís als investigadors. Tampoc no han trobat indicis d’accés no autoritzat als seus sistemes ni que les seves dades hagin estat compromeses.
Anthropic va comunicar a la policia que havia aturat el procés de proves després de descobrir l’incident.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.