최근 대규모 언어모델(LLM)의 활용 범위가 넓어지면서, 특정 목적에 맞춰 모델의 동작을 제어하는 기술이 주목받고 있습니다. 이 글에서는 LLM이 미리 정의된 몇 가지 선택지 중에서만 답변을 선택하도록 제한하는 '의사결정 모델(decision model)'을 직접 구축하는 방법을 제시합니다. 이는 일반적인 LLM이 자유로운 텍스트를 생성하는 것과 달리, 정해진 답변 풀(pool) 내에서 가장 적합한 답을 빠르게 찾아내는 데 중점을 둡니다.
이러한 의사결정 모델은 LLM의 출력 토큰(token)을 특정 옵션으로만 제한함으로써 구현됩니다. 예를 들어, 'A, B, C, D, E'와 같은 선택지를 주고 모델이 이 중 하나만 선택하도록 강제하는 방식입니다. 저자는 Qwen/Qwen3-1.7B 모델을 활용해 이를 시연했으며, 질문에 대한 답변으로 '하늘은 무슨 색인가?'에 '파란색'을 99.88%의 확률로 예측하는 등 높은 정확도를 보였습니다. 또한, CommonsenseQA 데이터셋으로 테스트했을 때 1.7B 모델임에도 59.38%의 정확도를 기록했으며, 미세조정(fine-tuning) 후에는 62.41%로 성능이 향상되었습니다.
그러나 모델이 특정 답변을 얼마나 확신하는지를 나타내는 '신뢰도 점수(confidence score)'가 실제 정확도와 일치하지 않는 '과신(overconfidence)' 문제가 발생할 수 있습니다. 예를 들어, 모델이 90~100%의 신뢰도를 보일 때 실제 정확도는 70%에 불과한 경우가 있었습니다. 이러한 문제를 해결하기 위해 '온도 스케일링(temperature scaling)'과 같은 보정(calibration) 기법이 중요합니다. 온도 스케일링은 모델의 출력 확률 분포를 조정하여 신뢰도 점수가 실제 정확도를 더 잘 반영하도록 돕는 역할을 합니다.
이러한 의사결정 모델 구축 방식은 LLM을 활용한 다양한 자동화 시스템에 큰 의미를 가집니다. 예를 들어, 고객 서비스 챗봇이 정해진 FAQ 내에서만 답변을 제공하거나, 설문조사 응답을 분류하는 등 특정 선택지를 기반으로 하는 작업에서 효율성을 극대화할 수 있습니다. 또한, 모델의 추론(inference) 과정을 단순화하여 응답 속도를 높이고 컴퓨팅 자원 소모를 줄이는 효과도 기대할 수 있습니다. 이는 제한된 자원으로도 고성능 AI 애플리케이션을 개발하려는 개발자들에게 특히 유용할 것입니다.