최근 UC 버클리 하스 스쿨(UC Berkeley Haas School)의 연구 결과에 따르면, 최신 인공지능(AI) 챗봇들이 인간과 유사하게 자신의 능력을 과신하는 경향이 있는 것으로 밝혀졌습니다. 이는 AI가 실제로는 틀린 답변을 하면서도 매우 높은 확신을 보이는 현상으로, AI의 신뢰성과 안전성 측면에서 중요한 시사점을 던집니다. AI의 발전과 함께 그 한계점 또한 명확히 이해해야 할 필요성이 커지고 있습니다.
연구팀은 다양한 대규모 언어모델(LLM)을 대상으로 복잡한 질문에 대한 답변과 그에 대한 확신도를 측정했습니다. 그 결과, AI 챗봇들은 어려운 문제일수록 오답을 내면서도 자신의 답변이 정확하다고 강하게 주장하는 모습을 보였습니다. 이러한 과신은 특히 모호하거나 정보가 부족한 상황에서 두드러지게 나타났는데, 이는 인간이 제한된 정보로 판단할 때 보이는 인지 편향과 매우 흡사합니다. 연구자들은 이러한 현상이 AI 모델의 학습 방식과 내부 추론(inference) 과정에서 발생하는 구조적인 문제일 수 있다고 분석했습니다.
AI 챗봇의 과신 문제는 단순히 재미있는 현상을 넘어 실제 응용 분야에서 심각한 위험을 초래할 수 있습니다. 예를 들어, 의료 진단, 금융 투자 자문, 자율 주행 시스템 등 높은 정확성과 신뢰성이 요구되는 분야에서 AI가 잘못된 정보를 확신에 차서 제공한다면 돌이킬 수 없는 결과를 낳을 수 있습니다. 따라서 AI 개발자들은 모델의 성능 향상뿐만 아니라, 불확실성을 인지하고 표현하는 능력을 강화하며, 과신을 줄이는 방향으로 AI 시스템을 설계하는 데 더욱 집중해야 할 것입니다. 이는 AI가 인간 사회에 더욱 안전하고 책임감 있게 통합되기 위한 필수적인 과제입니다.