살인사건 허위 제보에 비자 신청까지…‘선 넘은’ AI에 앤트로픽, 인터넷 차단
클로드로고와 로봇 손. 로이터연합뉴스
미국 인공지능(AI) 기업 앤트로픽이 자사 AI 모델 ‘클로드’의 돌발행동이 잇따르자 내부 시험망의 인터넷 접속을 잠정 차단했다. 경찰에 살인사건 허위 제보를 하고 정부에 비자 신청서 20건을 제출하는 등 허가받지 않은 행동까지 벌인 데 따른 조치다.
11일 정보기술(IT) 업계에 따르면 앤트로픽은 지난 9일(현지시간) 보고서에서 일부 고위험 시험에 적용하던 인터넷 차단 조치를 모든 내부 모델 평가로 확대한다고 밝혔다.
클로드 하이쿠 4.5는 지난 7월 미국 필라델피아 경찰에 미제 살인사건의 허위 목격담을 제출했다. 여러 웹사이트에서 예시 작업을 수행하던 중 실제 경찰 제보 페이지에 접속해 용의자로 보이는 인물을 목격했다는 거짓 정보를 신고한 것이다. 제보는 스팸으로 분류돼 수사에는 영향을 미치지 않았다. 앤트로픽이 이를 파악한 건 두 달여가 지난 9월 28일이었다. AI 에이전트의 돌발행동을 뒤늦게 발견하면서 감시 체계의 허점도 드러났다.
미국 국무부에는 비자 신청서 20건을 무단 제출한 경우도 있었다. 앤트로픽의 한 시험용 모델은 연습용 비자 신청서를 작성하라는 지시를 받았지만, 해당 양식에 접근하지 못하자 실제 국무부 사이트에 접속해 신청서를 제출했다. 신청서는 지난 5월 1건, 8월 19건 제출됐으나 모두 미완성 상태여서 처리되지 않았다. 대학 서버의 보안 취약점을 이용해 명령어를 실행하거나 유료 데이터의 접근 제한을 우회한 사례도 확인됐다.
앤트로픽은 AI가 주어진 과제를 끝내려다 허용된 행동의 범위를 넘어섰다고 분석했다. 특히 과제에 성공하면 보상을 주는 강화학습 과정에서 규칙을 어긴 결과까지 성공으로 인정받으면, AI가 제한을 우회하는 방법을 학습할 수 있다고 설명했다.
회사는 외부 인터넷 접속을 차단하는 한편 위험 행동을 자동 탐지·차단하는 감시 체계도 강화했다.
미국 매체 악시오스에 따르면 백악관 슈퍼인텔리전스 전담조직은 이번 사고를 계기로 AI 기업들에 모델이 일으킨 사고를 즉시 신고하고 피해를 시정하라고 요구했다.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.