대규모 언어모델(LLM)이 중요한 의사결정에 활용되면서, 모델이 내놓는 답변과 그에 대한 설명의 신뢰성(faithfulness)이 핵심 과제로 부상하고 있습니다. 모델의 설명이 실제 추론 과정을 제대로 반영하지 못하는 '불성실함(unfaithfulness)'은 감사(auditing) 및 안전성 측면에서 큰 문제를 야기할 수 있습니다. 최근 발표된 연구는 이러한 불성실함을 유발하는 두 가지 주요 원인 중 하나인 '불완전성(incompleteness)'에 초점을 맞춰 새로운 해결책을 제시했습니다.
기존 연구들은 설명이 실제 영향을 미치지 않은 요소를 언급하는 '불건전성(unsoundness)' 문제에 주로 집중하거나, 모델 가중치(weights)에 접근하고 막대한 컴퓨팅 자원을 필요로 하는 훈련 시점(training-time) 방법을 사용했습니다. 그러나 칭란 루오(Qinglan Luo) 외 연구진은 설명이 답변에 영향을 미친 요소를 누락하는 '불완전성' 문제를 직접적으로 다루는 테스트 시점(test-time) 접근법을 개발했습니다. 이 방법은 LLM이 제공한 설명에서 언급되지 않은 개념들을 원본 입력에서 제거한 후, 축소된 입력으로 모델에 다시 질의하는 방식입니다. 이를 통해 설명에 언급되지 않은 숨겨진 영향 요소를 제거하고, 언급된 개념들의 영향력을 보존하여 설명의 신뢰도를 높입니다.
이러한 '제거 기반(removal-based)' 접근법은 모델에 구애받지 않는(model-agnostic) 특성을 가지며, 모델 매개변수(parameters)를 수정할 필요 없이 추론 시점(inference time)에 바로 적용할 수 있다는 큰 장점이 있습니다. 연구진은 두 가지 데이터셋, 여러 모델 계열, 그리고 두 가지 독립적인 신뢰성 지표를 사용하여 이 방법이 표준 프롬프팅(prompting)이나 신뢰성을 장려하는 프롬프팅보다 설명의 신뢰성을 향상시킨다는 것을 입증했습니다. 이는 LLM 기반 의사결정 시스템의 신뢰성과 안전성을 높이는 유연한 메커니즘을 제공하며, 숨겨진 영향력을 줄여 모델 행동을 더 투명하게 이해하는 데 기여할 것으로 기대됩니다.