인공지능(AI) 기반 질의응답(QA) 시스템에서 추론 과정에 대한 설명(rationale)이 실제 어떤 역할을 하는지에 대한 의문이 제기되었습니다. 최근 발표된 연구에 따르면, 추론기(reasoner)가 생성한 설명을 검증기(verifier)에 전달하는 방식이 최종 답변의 정확도를 높이는 데는 큰 효과가 없으며, 오히려 잘못된 설명은 검증기의 판단을 오도할 수 있는 것으로 나타났습니다.
이 연구는 메시지 개입 진단(message-intervention diagnostic)이라는 새로운 방법을 도입하여, 증거와 후보 답변을 고정한 채 추론기와 검증기 사이에서 전달되는 설명만을 변화시켰습니다. DeepSeek 모델을 생성기와 검증기로 활용하여 400개의 MuSiQue, HotpotQA, 2WikiMultiHopQA 데이터셋 예시를 분석한 결과, 신뢰할 수 있는 설명은 설명이 없는 경우에 비해 답변 정확도를 거의 높이지 못했습니다. 반면, 조작된(corrupted) 설명은 검증기의 지지 판단(support judgment)을 크게 변화시켰습니다. 예를 들어, 무해한 설명 변경은 지지 판단을 0~2.5%만 이동시켰지만, 조작된 설명은 10~22%까지 이동시켰으며, 명시적인 설명 확인 프롬프트(rationale-checking prompt)를 사용했을 때는 그 영향이 34~55%로 증폭되었습니다. 최종 답변 변화는 2~30% 수준이었고, 조작된 설명으로 인한 지지 판단 오류 중 2.9~35.3%만이 답변 변경으로 이어졌습니다. 인간 감사(human audit) 결과, 모델이 수용한 조작된 설명 중 상당수가 인간에게는 명확하지 않거나 거부되는 경우였습니다.
이 연구 결과는 AI 시스템 내부에서 설명이 전달되는 방식과 그 효과에 대한 중요한 시사점을 제공합니다. 단순히 더 나은 답변 정확도를 얻기 위한 수단으로 설명을 활용하기보다는, AI가 특정 답변을 도출한 근거를 검증하고 신뢰성을 평가하는 메커니즘으로서 설명 공유를 재평가해야 한다는 것입니다. 이는 AI 시스템의 투명성과 신뢰성을 높이는 데 필수적인 요소이며, 특히 중요한 의사결정에 AI가 활용될 때 그 근거를 명확히 하고 잠재적 오류를 식별하는 데 기여할 수 있습니다.
