인공지능(AI)이 생성한 코드를 다른 언어모델(LM)이 평가할 때, 종종 근거가 부족함에도 불구하고 마치 확신에 찬 것처럼 정답을 내놓는 문제가 발생합니다. 이는 AI 코드 심사 결과의 신뢰성을 떨어뜨리는 주요 원인으로 지목되어 왔습니다. 최근 발표된 연구는 이러한 '근거 없는 자신감' 문제를 해결하기 위한 두 가지 새로운 측정 기준과 함께, 판단 근거가 불충분할 때 아예 추측을 거부하는(declines to guess) AI 심사 모델을 제안했습니다.
기존의 다중 에이전트(multi-agent) 검증 방식은 판단을 여러 단계로 나누어 증거에 기반해 검증하는 유망한 접근 방식입니다. 하지만 이 연구는 코드 심사 시 이러한 방식이 제대로 작동하려면 증거가 '평가 대상 답변과 독립적'이어야 하고, '비교 대상 후보들 간에 차이가 있어야 한다'는 두 가지 조건이 필요하다고 주장합니다. 특히 코드 심사에서는 두 번째 조건이 충족되지 않는 경우가 많아, 기존 프레임워크인 MARCH를 벤치마크에 적용했을 때 78~95%의 경우 두 솔루션을 동일하게 평가하며 4.4%의 낮은 정확도를 보였습니다. 이는 직접 질문했을 때의 43.7%와 큰 차이를 보입니다. 연구팀은 파이프라인 로그에서 얻은 두 가지 측정값을 활용해 이러한 문제를 라벨(label) 없이 설명했으며, 이 중 하나를 기준으로 판단을 유보하도록 했을 때 정확도가 20.7%에서 36.9%로 향상됨을 확인했습니다.
이 연구의 핵심 기여는 더 정확한 심사기를 만드는 것이 아니라, 심사기가 언제 판단 근거가 없는지 라벨 없이 식별하는 방법을 제시했다는 점입니다. 이는 AI 코드 심사, 나아가 일반적인 AI 기반 의사결정 시스템의 신뢰성을 높이는 데 중요한 시사점을 제공합니다. AI가 단순히 정답을 내놓는 것을 넘어, 자신의 판단에 대한 '자신감 수준'과 '근거의 유무'를 스스로 평가하고 보고할 수 있게 된다면, 개발자나 사용자들은 AI의 판단을 더욱 신뢰하고 중요한 결정에 활용할 수 있을 것입니다. 이는 AI 시스템의 투명성과 책임성을 강화하는 데 기여하며, 향후 AI 개발 및 활용 방식에 큰 변화를 가져올 잠재력을 가집니다.
