대규모 언어모델(LLM)의 추론(inference) 성능을 개선하기 위한 자동화된 '하네스(harness)' 생성 기술이 주목받고 있습니다. 하네스란 특정 태스크에 LLM을 더 잘 활용하도록 돕는 보조 프로그램이나 프롬프트 집합을 의미합니다. 기존에는 이러한 하네스를 통해 LLM이 특정 태스크에 전문화(specialization)되어 성능이 향상될 것으로 기대했지만, 실제로는 동일한 하네스 프로그램을 반복 실행하는 것만으로도 더 많은 답변을 얻을 수 있어(답변 커버리지 증가) 진정한 전문화 효과를 측정하기 어렵다는 문제가 제기되었습니다.
Ziyang Xu 외 7명의 연구진은 이 문제를 해결하기 위해 통제된 평가 방식을 도입했습니다. 이들은 386개의 MATH-500 수학 문제 태스크를 사용하여, 8개의 생성된 하네스와 1개의 기준선(baseline) 하네스를 비교했습니다. 특히, 기준선 하네스는 9개의 바이트 단위로 동일한 복사본을 만들어 각 멤버당 3회씩 실행하며, 답변 커버리지, 반복 가능한 태스크 이점, 그리고 사전 실행 선택으로 인한 이득을 분리하여 분석했습니다. 연구 결과, 동일한 프로그램을 반복 실행하는 것만으로도 평균 2.16%포인트의 오라클(oracle) 성능 향상 여지가 있음을 발견했습니다. 생성된 프로그램들은 더 반복적인 스코어 패턴을 보였지만, 이는 주로 지속적인 약점을 드러냈습니다. 100개 태스크에서는 기준선 대비 손실이 3회 반복 모두에서 지속되었고, 지속적인 승리는 단 1개 태스크에서만 나타났으며 답변 추출 방식에 민감했습니다. 이는 단순히 여러 프로그램을 시도하거나 반복 실행하는 것만으로는 진정한 태스크 전문화를 통한 성능 향상을 기대하기 어렵다는 것을 의미합니다.
이 연구는 LLM 하네스 평가에 있어 새로운 기준의 필요성을 강조합니다. 단순히 더 많은 답변을 얻거나 반복적으로 좋은 결과를 내는 것만으로는 유용한 전문화를 주장할 수 없다는 것입니다. 진정한 전문화는 태스크 이점이 여러 실행에 걸쳐 지속되어야 하고, 활용 가능한 의사결정을 유도하며, 동일한 추론 예산(inference budget) 내에서 추가적인 고정 프로그램 실행보다 개선된 성능을 보여야 한다고 제안합니다. 이는 LLM 개발자들이 하네스 설계 시 양적인 확장보다는 질적인 다양성과 실제 문제 해결 능력을 높이는 데 집중해야 함을 시사하며, LLM 기반 애플리케이션의 신뢰성과 효율성을 높이는 데 중요한 지침이 될 것입니다.
