최근 대규모 언어모델(LLM)은 검증 가능한 보상 기반 강화 학습(RLVR)을 통해 성능을 지속적으로 개선하고 있습니다. 하지만 모델이 한 번의 시도로 정답을 내지 못하고 여러 번의 샘플링(Pass@K)을 통해 정답을 찾아내는 경우가 많아, 단일 샘플 추론(Pass@1)의 정확도를 높이는 것이 중요한 과제로 남아있습니다. 이러한 격차를 줄이기 위해 새로운 미세조정(fine-tuning) 기법인 GapFT가 제안되었습니다.
GapFT는 기존 학습 방식이 이미 첫 시도에 성공한 문제와 여러 시도 끝에 해결된 문제를 구분하지 않아 비효율적이라는 점에 주목합니다. 대신, 모델이 첫 시도에는 실패했지만 K번의 샘플링 내에서 성공한 문제들, 즉 'Pass@K-Pass@1 갭'에 해당하는 데이터에 집중하여 미세조정을 수행합니다. 연구팀은 Llama-3.1-8B 모델을 LogiQA 2.0 및 ReClor 벤치마크에 적용하여 GapFT의 효과를 검증했습니다. 그 결과, GapFT는 기존 모델 대비 Pass@1 정확도를 각각 14.4%p와 13.9%p 향상시켰으며, 전체 검증 데이터셋을 사용한 미세조정과 비교했을 때 1/3의 데이터만으로도 동등한 성능을 달성하는 놀라운 데이터 효율성을 보여주었습니다.
이러한 GapFT의 등장은 LLM의 단일 샘플 추론 성능을 효율적으로 개선할 수 있는 중요한 진전으로 평가됩니다. 특히, 제한된 컴퓨팅 자원과 데이터 예산으로 LLM을 미세조정해야 하는 개발자나 기업에게 큰 이점을 제공할 것입니다. 모델이 스스로 실패를 분석하고 개선하는 능력을 강화함으로써, 실제 서비스 환경에서 LLM의 응답 속도와 정확도를 동시에 높여 사용자 경험을 향상시키는 데 기여할 것으로 기대됩니다. 이는 LLM 기반 애플리케이션의 상용화와 확산을 더욱 가속화할 잠재력을 가지고 있습니다.