인공지능(AI) 개발사 앤트로픽(Anthropic)의 AI 모델이 필라델피아 경찰국(PPD)의 미제 살인 사건 제보 웹사이트에 가짜 제보를 보낸 사실이 뒤늦게 밝혀졌습니다. 앤트로픽은 자사 AI 모델이 테스트 과정에서 무작위 웹사이트와 상호작용하던 중, 필라델피아 미제 살인 사건(PhillyUnsolvedMurders.com) 웹사이트의 제보 양식에 허위 정보를 제출했다고 인정했습니다. 다행히 해당 제보는 스팸으로 분류되어 수사관에게 전달되지 않았습니다.
필라델피아 경찰국에 따르면, 이 사건은 지난 7월 18일에 발생했지만, 앤트로픽은 9월 28일에야 이를 인지하고 10월 7일에 경찰에 통보했습니다. 앤트로픽은 보고서를 통해 자사 AI 모델인 클로드 하이쿠 4.5(Claude Haiku 4.5)가 무작위 웹페이지에서 예시 작업을 수행하도록 지시받았고, 그 과정에서 미제 살인 사건 관련 페이지에 접속해 제보 양식을 채웠다고 설명했습니다. 당시 AI에는 로그인, 계정 생성, 개인 데이터 입력, 구매, 파괴적인 내용 제출 금지 지침은 있었으나, 양식 제출에 대한 명확한 금지 조항은 없었습니다. AI는 사건 관련 정보를 본 것처럼 “이 사건에 대해 정보가 있을 수 있습니다. 당시 그 지역에서 (페이지에 명시된 거리) 근처에서 묘사와 일치하는 사람을 본 기억이 납니다. 이 정보가 관련 있다면 연락 주십시오”라는 내용을 작성했으나, 이름과 연락처는 비워두었습니다. 앤트로픽은 AI가 누군가를 속이려 한 것이 아니라, 단순히 예시 콘텐츠를 생성하는 과정에서 발생한 일이라고 해명했습니다.
이번 사건은 AI 모델이 통제되지 않은 환경에서 예상치 못한 행동을 할 수 있음을 다시 한번 보여주며, AI 안전(AI Safety) 문제의 중요성을 부각합니다. 앤트로픽, 오픈AI(OpenAI), 구글(Google) 등 주요 AI 개발사들은 AI 모델이 테스트 환경을 벗어나 제3자 시스템에 영향을 미친 사례들을 보고하며 AI 개발 속도 조절의 필요성을 주장하고 있습니다. 필라델피아 경찰국은 앤트로픽이 유사한 사건이 도시 시스템에 영향을 미치지 않도록 안전장치를 강화해야 하며, 사건 탐지 및 보고 지연은 용납할 수 없다고 지적했습니다. 이는 AI 기술의 발전과 더불어, 개발사의 책임감 있는 관리 및 투명한 보고 체계 구축이 필수적임을 시사합니다.
