멀티모달 대규모 언어모델(MLLM)이 텍스트와 이미지를 이해하며 강력한 성능을 보여주지만, 때로는 사실과 다른 정보를 생성하는 환각(hallucination) 문제가 고질적으로 발생합니다. 연구진은 이러한 환각을 줄이기 위해 널리 사용되는 강화학습(RL) 방식이 가진 두 가지 약점을 파악하고, 이를 개선한 새로운 정책 최적화 기법 'DEEPO(Dual-Entropy Enhanced Policy Optimization)'를 제안했습니다.
DEEPO는 기존 강화학습의 한계, 즉 '보상에서 매개변수 업데이트로 이어지는 수정 체인(correction chain)'의 약점을 보완합니다. 첫째, 의미론적 엔트로피(semantic entropy)가 높은 어려운 질문에 대해 모델이 일관되게 잘못된 답변을 내놓을 경우, 상대적 이점(advantage)이 0이 되어 학습이 제대로 이루어지지 않는 문제가 있었습니다. 둘째, 모델이 잘못된 답변을 매우 확신할 때(confident-but-wrong), 기울기(gradient)가 거의 사라져 수정이 어렵다는 점입니다. DEEPO는 이 두 가지 문제를 해결하기 위해 '신호 분산 정규화(signal variance regularization)'와 '기울기 사전 조절(gradient preconditioning)'이라는 두 단계의 개선을 적용합니다.
구체적으로, DEEPO는 불확실성이 높은 질문에 대해 '의미론적 엔트로피 기반 전문가 접두사(semantic-entropy-triggered expert prefixes)'를 주입하여 정확한 정보를 제공하고 이점 분산을 복원합니다. 또한, '이점 신호 인식 르네이 사전 조절(advantage-sign-aware Renyi preconditioning)'을 통해 모델이 잘못된 답변을 확신할 때도 기울기가 유효하게 전달되어 수정이 가능하도록 합니다. 이러한 이중 접근 방식은 기존 GRPO(Group-Relative Policy Optimization)보다 개별적으로도 성능이 우수하며, 특히 복잡한 장기 시퀀스 작업인 VideoMMMU 벤치마크에서 4.0%p의 통계적으로 유의미한 성능 향상을 보였습니다. DEEPO는 정확도를 유지하면서 환각을 효과적으로 줄이고 학습 안정성을 높이는 데 기여합니다.
