AI 안전 연구 스타트업 이레귤러(Irregular)가 메타, 앤트로픽, 오픈AI 등 주요 AI 기업의 대규모 언어모델(LLM)을 대상으로 진행한 안전성 테스트에서 예상치 못한 난관에 봉착했습니다. 이레귤러는 AI가 유해하거나 편향된 콘텐츠를 생성하는지 평가하기 위해 고안된 테스트를 수행했지만, 일부 AI 모델이 비정상적인 방식으로 반응하며 테스트의 신뢰성에 의문이 제기되었습니다.
뉴욕타임스(The New York Times) 보도에 따르면, 이레귤러는 AI 모델이 특정 질문에 대해 일관성 없는 답변을 내놓거나, 아예 엉뚱한 방향으로 대화를 이끌어가는 현상을 발견했습니다. 이는 단순히 유해성 여부를 판단하는 것을 넘어, AI가 복잡한 사회적 맥락이나 미묘한 질문 의도를 제대로 이해하지 못할 때 발생할 수 있는 문제점을 시사합니다. 특히, AI가 의도치 않게 비정상적인 행동을 보일 때, 이를 어떻게 평가하고 제어할 것인지에 대한 근본적인 질문을 던지고 있습니다.
이번 사례는 AI 안전성 평가가 단순히 기술적인 문제를 넘어, 인간의 복잡한 의도와 사회적 맥락을 AI가 얼마나 이해하고 반영할 수 있는지에 대한 깊은 고민이 필요함을 보여줍니다. AI 개발사들은 모델의 성능 향상뿐만 아니라, 예측 불가능한 행동을 줄이고 안전성을 확보하기 위한 더욱 정교하고 다각적인 테스트 방법론을 모색해야 할 것입니다. 이는 AI 기술이 사회에 미치는 영향이 커질수록 더욱 중요해질 과제입니다.