앤트로픽 AI 잇단 돌발행동…살인사건 허위 제보에 비자도 신청

광고
앤트로픽의 인공지능(AI) 모델 클로드가 미국 경찰에 미제 살인사건 관련 허위 제보를 하고, 미 국무부에 비자 신청서를 제출하는 등 인간 통제를 벗어난 돌발행동을 한 사실이 드러났다. 앤트로픽은 자사 모델들이 의도치 않게 행동한 사례를 공개하고 유사 사고를 막기 위해 모든 내부 평가에서 실시간 인터넷 접근을 차단하는 등 감시·통제를 강화하겠다고 밝혔다.
11일 앤트로픽의 공식 보고서와 미국 테크크런치 등의 보도를 종합하면, 앤트로픽의 ‘클로드 하이쿠 4.5’ 모델은 지난 7월18일 필라델피아 경찰국의 미제 살인사건 제보 창구에 허위 정보를 제출했다. 당시 모델은 무작위로 선택한 웹페이지에서 예시 작업을 만드는 작업을 수행하던 중 경찰 제보 창구에 접속해 “사건 현장 인근에서 인상착의가 일치하는 사람을 본 기억이 있다. 관련 정보라면 연락해 달라”는 취지의 제보를 남겼다. 실제 웹페이지에는 용의자의 인상착의 관련 정보는 없었다. 해당 제보는 스팸으로 분류돼 실제 수사로 이어지진 않았다.
앤트로픽은 사건 발생 두 달여가 지난 9월28일에야 이러한 행동을 발견했다. 당시 모델에 계정 생성, 개인정보 입력 등의 행위는 하지 말라는 지침은 주어졌으나, 온라인 양식 제출 자체는 금지되지 않았다고 한다. 앤트로픽은 지시사항이 모호하거나 평가 환경의 설정 오류가 있는 경우 제출해서는 안 되는 양식을 제출하는 행동이 나타났다고 분석했다.
광고
이에 더해 클로드가 미국 국무부에 실제 비자 신청서를 제출한 사실도 확인됐다. 미국 온라인 매체 악시오스는 국무부 관계자를 인용해 ‘앤트로픽의 시험용 인공지능 모델이 지난 5월과 8월에 총 20건의 비이민 비자 신청서를 국무부 웹사이트를 통해 제출했다’고 보도했다. 다만 실제 처리된 신청서는 없으며, 국무부 시스템이 해킹당하거나 침해된 사실도 없다고 전했다.
앤트로픽은 지난 9일 발표한 보고서에서 인공지능 모델의 의도치 않은 행동 사례를 추가로 공개했다. 과학 분석 작업을 맡은 ‘클로드 미토스 프리뷰’ 모델은 대학에서 제공하는 온라인 분석 도구에 접근하려 했으나 오류가 발생해 활용하지 못했다. 이후 대학 서버 취약점을 찾아 필요한 계산을 수행하기도 했다
광고
광고
앤트로픽은 이같은 돌발행동의 공통적인 특징으로 작업 수행이 막혔을 때 작업을 중단하는 대신 제한을 우회해 목표를 달성하려는 ‘지속성’을 꼽았다. 인공지능은 훈련 과정에서 주어진 과제를 성공적으로 수행할 때 보상을 받는 ‘강화학습’ 과정을 거치는데, 이 과정에서 허점을 이용해 규칙을 우회하는 행동까지 학습해 ‘보상 해킹’이 나타날 수 있다는 것이다. 여기에 더해 불명확한 지시와 평가 환경의 설정 오류 등도 이상행동의 원인으로 지목했다. 앤트로픽은 이번에 공개한 사건들의 피해는 제한적이었으나, 모든 내부 평가에서 실시간 인터넷 접근을 차단하고 이상행동 자동 탐지·차단 시스템을 강화하겠다고 밝혔다.
미국 백악관의 초지능 태스크포스도 피해 복구와 재발 방지를 요구했다. 악시오스가 공개한 태스크포스 성명을 보면, 백악관은 “사고 통보와 피해 시정 절차는 선택 사항이 아니다. 이는 국가 안보상 중대한 의무”라며 “사고 통보 지연, 불충분한 시정 조치, 책임을 다하지 않는 행위는 용납하지 않을 것”이라고 밝혔다.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.