대규모 언어모델(LLM)의 성능을 평가하는 현재의 순위표(leaderboard)가 평가 방식(harness)에 따라 크게 달라질 수 있다는 충격적인 연구 결과가 발표되었습니다. 아카이브(arXiv)에 게재된 논문 'There Is No Neutral Harness'에 따르면, 객관식 벤치마크에서 질문과 정답은 고정되어 있지만, 옵션 순서, 프롬프트 문구, 답변 추출 방식 등 '평가 방식'의 미묘한 차이가 모델의 점수와 순위를 완전히 뒤바꿀 수 있다고 합니다.
연구팀은 12개의 오픈소스 LLM을 대상으로 4가지 벤치마크(ARC, HellaSwag, MMLU, TruthfulQA)의 3,679개 문항을 26가지 평가 방식 설정으로 테스트했습니다. 그 결과, 한 모델(gemma4-31b)의 점수가 평가 방식에 따라 31%에서 89%까지 크게 변동하는 것을 확인했습니다. 특히, 인접한 두 모델 간의 성능 격차 중 95.7%가 이러한 '설정-취약(config-fragile)' 문항에서 발생했으며, 심지어 12개 모델 중 4개는 특정 평가 방식에서 1위를 차지할 수 있었습니다. 이는 현재의 LLM 순위표가 평가 방식에 의해 '만들어지고' 있음을 시사합니다.
이 연구는 LLM 벤치마크의 신뢰성에 심각한 의문을 제기합니다. 단순히 점수만으로 모델의 우열을 가리는 것이 얼마나 위험한지 보여주며, 특정 평가 방식에 최적화된 모델이 실제 성능보다 과대평가될 수 있음을 의미합니다. 앞으로 LLM 개발자와 사용자들은 벤치마크 점수를 해석할 때 평가 방식의 영향을 반드시 고려해야 하며, 더욱 견고하고 공정한 평가 방법론에 대한 논의가 필요할 것입니다. 연구팀은 이러한 취약성을 검증할 수 있는 도구와 데이터를 공개하여, 순위표가 발표되기 전에 자체 검증을 거칠 것을 제안했습니다.
