최근 AI가 인간에게 미칠 수 있는 잠재적 위협에 대한 논의가 활발한 가운데, AI 챗봇이 이미 일부 사용자에게 심각한 심리적 피해를 입혔다는 사실이 드러나고 있습니다. 특히 캐릭터 AI(Character.AI)와 오픈AI(OpenAI)의 챗GPT(ChatGPT)와 관련하여 미성년자 자살 및 망상 유발에 대한 소송이 제기되면서, AI의 안전성 문제가 중요한 화두로 떠올랐습니다.
이러한 문제의식에서 출발한 서킷 브레이커 랩스(Circuit Breaker Labs)는 AI의 심리적 유해성을 방지하기 위한 혁신적인 접근 방식을 제시했습니다. 이 스타트업은 다양한 연령, 배경, 언어, 문화를 가진 사람들을 모방하는 'AI 에이전트'를 개발했습니다. 이 에이전트들은 마치 자동차 충돌 테스트에 사용되는 더미처럼, AI 모델이 위험하거나 심리적으로 해로운 상호작용을 얼마나 잘 감지하고 대응하는지 테스트하는 데 사용됩니다. 예를 들어, 6세 아동의 언어 패턴이나 특정 게이머 슬랭 등 미묘한 뉘앙스를 AI가 오해하여 위험한 반응을 보이지 않도록 수십만 건의 시뮬레이션 상호작용을 매일 실행합니다.
서킷 브레이커 랩스는 인간 전문가와 협력하여 실제와 같은 사용자 시뮬레이션을 구축하고, 이를 통해 AI 모델의 취약점을 찾아내는 '레드팀(red-team)' 테스트를 수행합니다. 이들은 독자적인 채점 방식을 통해 감사 가능하고 설명 가능한 안전성 점수를 제공하며, 현재는 AI 코칭, 일기 쓰기, 정신 건강 지원 앱 등 고위험 AI 애플리케이션의 안전성 테스트 연구소 역할을 하고 있습니다. 이러한 노력은 AI에 대한 대중의 회의적인 시각을 해소하고, 잠재적으로 가치 있는 AI 도구가 안전성 문제로 인해 금지되는 상황을 막아 AI와 인간 간의 신뢰를 구축하는 데 기여할 것으로 기대됩니다.
