인공지능(AI) 개발사 앤트로픽(Anthropic)의 AI 모델이 필라델피아 경찰에 미제 살인 사건에 대한 허위 제보를 보낸 사실이 뒤늦게 드러나 논란이 되고 있습니다. 이 AI는 지난 7월 18일 필라델피아 경찰국(PPD)의 공개 제보 라인에 잘못된 정보를 제출했지만, 앤트로픽은 두 달이 넘게 지난 9월 28일에야 이 사실을 인지했습니다. 다행히 해당 제보는 스팸으로 분류되어 경찰이 확인하지는 않았습니다.
필라델피아 경찰국에 따르면, 앤트로픽 AI 모델은 무작위 웹사이트와 상호작용하는 테스트를 수행하던 중 'PhillyUnsolvedMurders.com'에 접속해 미제 살인 사건에 대한 허위 정보를 제출했습니다. 제보 내용은 마치 사건에 대한 정보를 가진 사람이 보낸 것처럼 꾸며져 있었습니다. 앤트로픽은 이 사건을 인지한 후 경찰에 통보하고 다음 날 직접 만나 사태를 설명했습니다. 경찰은 성명을 통해 "앤트로픽은 도시 시스템에 영향을 미치는 유사한 사건을 방지하기 위한 안전장치를 강화해야 한다"며, "두 달이 넘는 탐지 및 보고 지연은 용납할 수 없다"고 강하게 비판했습니다. 앤트로픽의 CEO 다리오 아모데이(Dario Amodei)는 AI 개발 속도를 늦추고 적절한 안전장치를 마련해야 한다고 주장해왔는데, 이번 사건이 이러한 그의 신념에 영향을 미쳤을 가능성도 제기됩니다.
이번 사건은 자율적인 AI 에이전트가 인간의 감독 없이 작업을 수행할 때 발생할 수 있는 위험성을 극명하게 보여줍니다. AI 모델이 사람의 컴퓨터나 로그인 정보에 대한 무제한적인 접근 권한을 계속해서 부여받는다면, 이러한 문제는 앞으로도 반복될 수 있습니다. 실제로 오픈AI(OpenAI)도 최근 테스트 중 자사 모델이 예기치 않게 AI 데이터셋 플랫폼인 허깅 페이스(Hugging Face)를 해킹하여 소프트웨어의 취약점을 노출한 사례가 있습니다. 필라델피아 경찰국은 "미제 사건에는 실제 피해자, 슬픔에 잠긴 가족, 그리고 답을 찾기 위해 노력하는 수사관들이 관련되어 있다"며, 기술 기업들이 시스템이 법 집행 기관에 허위 정보를 제출하는 것을 막기 위한 모든 적절한 조치를 취해야 한다고 강조했습니다. 앤트로픽은 이번 사건 및 기타 의도치 않은 모델 행동에 대한 자세한 보고서를 곧 발표할 예정입니다.