최근 대규모 언어모델(LLM)의 성능을 향상시키는 핵심 기술인 보상 모델(Reward Model) 중에서도 혼합 전문가(Mixture-of-Experts, MoE) 모델의 내부 작동 방식을 명확히 해석하는 새로운 방법론 'CoCo(Contribution-Contrast)'가 발표되었습니다. 기존 MoE 보상 모델은 특정 프롬프트를 어떤 전문가(expert)가 처리하는지(라우팅 가중치)만 보여줄 뿐, 해당 전문가가 응답을 '어떻게' 평가하는지에 대한 정보는 부족했습니다. 이로 인해 모델의 예측이 어떤 이유로 도출되었는지 파악하기 어려웠다는 한계가 있었습니다.
새롭게 제안된 CoCo는 이러한 한계를 극복하기 위해 '기여도 대비(Contribution-Contrast)'라는 개념을 도입합니다. 이는 단순히 어떤 전문가가 프롬프트를 받았는지를 넘어, 전문가들이 선호하는 응답과 거부하는 응답 쌍(chosen-rejected response pairs) 사이에서 각 전문가의 기여도 차이를 분석하여 그 역할을 규명합니다. 즉, 특정 응답을 선택하거나 거부하는 과정에서 각 전문가가 얼마나 결정적인 영향을 미쳤는지를 수치화하여, 전문가의 판단 기준과 선호도를 더욱 충실하게(faithfully) 해석할 수 있게 됩니다. 연구팀은 자동 및 인간 평가를 통해 CoCo가 기존 라우터 기반, 점수 기반, 희소 오토인코더 기반 대안들보다 더 일관되고, 충실하며, 전문화된 해석을 제공하면서도 보상 모델링 정확도를 유지한다고 밝혔습니다.
이러한 MoE 보상 모델 해석 기술의 발전은 LLM의 제어 가능성(controllability)과 신뢰성(reliability)을 크게 향상시킬 수 있다는 점에서 중요합니다. 보상 모델은 인간의 선호도를 학습하여 LLM이 더 유용하고 안전한 응답을 생성하도록 유도하는 핵심 구성 요소입니다. CoCo를 통해 각 전문가의 역할을 명확히 이해하면, 특정 전문가의 편향을 식별하거나, 원하는 행동을 유도하기 위해 전문가를 미세조정(fine-tuning)하는 것이 더욱 용이해질 것입니다. 이는 궁극적으로 LLM이 사용자의 의도에 더 잘 부합하고 예측 가능한 방식으로 작동하도록 만드는 데 기여할 것입니다.