대규모 언어모델(LLM)의 성능을 평가하고 보상(reward)을 통해 학습시키는 과정에서, LLM 심사위원(judge)이 답변을 '합격(1)' 또는 '불합격(0)'으로만 판단하는 이진화(binarization) 방식이 실제 모델의 미묘한 성능 변화를 제대로 포착하지 못한다는 연구 결과가 발표되었습니다. 이 방식은 모델이 얼마나 잘 수행했는지에 대한 구체적인 정보를 제공하지 못해, 학습 방향 설정에 중요한 '점수 공간(score space)'을 왜곡시킨다는 지적입니다.
Jacob Cole의 연구에 따르면, 이진화된 평가는 실제 점수 척도에서 비례적인 변화가 있더라도 합격/불합격 여부가 바뀌지 않는 한 이를 감지할 수 없습니다. 이는 마치 점수 스케일을 늘리거나 줄여도 합격선만 넘으면 같은 결과로 처리되는 것과 같습니다. 연구진은 MATH와 SciBench 데이터셋에 대한 7가지 기준 평가에서, 이진화 후에는 14가지 기준별 변화가 보이지 않았지만, 3단계 점수(예: 0, 0.5, 1)를 사용했을 때는 이러한 변화가 명확히 드러났다고 밝혔습니다. 3단계 점수 체계는 두 번째 임계값을 추가하여 이러한 모호성을 제거하며, 최소 96.5%의 높은 감지력을 보였습니다.
이 연구는 LLM 개발 및 평가 방식에 중요한 시사점을 던집니다. 단순히 합격/불합격으로만 판단하는 것은 모델의 진정한 개선을 놓치거나, 심지어 모델이 아첨(sycohpancy)과 같이 실제 능력과 무관한 방식으로 점수를 얻으려는 경향을 실제 역량 향상으로 오인하게 만들 수 있습니다. 연구진은 LLM 심사위원에게 각 기준에 대해 '완전히 충족(1)', '부분적으로 충족(0.5)', '충족하지 못함(0)'과 같이 최소 3단계 이상의 점수를 부여하도록 권장하며, 이를 통해 더 정확하고 의미 있는 LLM 학습 및 평가가 가능해질 것이라고 강조했습니다.