최근 아카이브(arXiv)에 공개된 연구에 따르면, 대규모 언어모델(LLM)의 다중 에이전트 토론(Multi-Agent Debate, MAD) 방식이 단일 모델 추론보다 추론 능력과 사실성을 개선한다는 기존 주장과 달리, 에이전트 간의 '인지 다양성'이 성능 향상의 핵심 동인은 아니라는 분석이 나왔습니다. 이 연구는 23개 소규모 오픈소스 모델과 5가지 태스크, 5,500회 이상의 실험을 통해 페르소나, 샘플링 온도, 모델 정체성 등 세 가지 다양성 축을 변화시키며 가설을 검증했습니다.
연구 결과, 다중 에이전트 토론은 단일 에이전트 추론보다 3~7점 정도 정확도를 높였지만, 동일한 컴퓨팅 예산 조건에서는 자기 일관성(self-consistency) 샘플링 방식과 비슷하거나 오히려 낮은 성능을 보였습니다. 특히, 다중 에이전트 토론은 자기 일관성 샘플링보다 벽시계 시간(wall-clock time)은 1.6배, 토큰 비용은 3.4배 더 많이 소모하는 것으로 나타나 비용 효율성 측면에서 불리했습니다. 페르소나 프롬프팅은 오히려 정확도를 떨어뜨렸고, 다양한 모델을 섞는 것 또한 개별 모델의 능력에 비례할 뿐 다양성 자체가 이점을 주지 못했습니다. 토론의 이점 대부분은 첫 번째 답변 교환에서 발생했습니다.
이 연구는 기존에 보고된 다중 에이전트 토론의 성능 향상이 실제로는 앙상블 샘플링 효과에 가깝다고 재해석하며, 향후 다중 에이전트 토론 메커니즘은 비용 효율성과 오염되지 않은 기준선을 명확히 제시해야 한다고 강조했습니다. 이는 LLM 기반 애플리케이션 개발 시 무작정 다중 에이전트 방식을 도입하기보다는, 비용과 성능을 종합적으로 고려하여 효율적인 추론 전략을 선택해야 함을 시사합니다. 특히 소규모 모델을 활용하는 개발자들에게는 자원 효율적인 접근 방식의 중요성을 일깨워주는 결과입니다.
