최근 GLM-5.3-Flash 모델이 추가적인 미세조정(fine-tuning) 없이도 정형화된 의사결정 작업에서 뛰어난 성능을 발휘하는 방법이 공개되었습니다. 이는 고객 문의를 특정 팀에 배정하거나, 계약 조항이 특정 범주에 속하는지 판단하는 등 미리 정의된 선택지 중 하나를 고르고 각 선택지의 확률을 반환해야 하는 시나리오에 특히 유용합니다. 기존 대규모 언어모델(LLM)은 이런 작업을 위해 긴 JSON 형식의 응답을 생성해야 했기에 속도와 비용 측면에서 비효율적이었지만, 이 새로운 접근 방식은 단 한 번의 순전파(forward pass)로 필요한 판단을 얻어냅니다.
이 기술은 LLM이 텍스트를 직접 생성하는 대신 다음 토큰의 확률 분포를 출력한다는 점에 착안했습니다. 즉, 모델이 긴 문장을 만드는 대신, 미리 정의된 선택지 번호에 해당하는 다음 토큰의 확률만 읽어 가장 높은 확률의 선택지를 고르는 방식입니다. Privatemode가 공개한 벤치마크에 따르면, GLM-5.3-Flash는 28개 공개 텍스트 데이터셋에서 Jev와 비슷한 정확도를 기록했습니다. 각각 10개 데이터셋에서 GLM-5.3-Flash가 앞섰고, 나머지 8개에서는 1%p 이내의 근소한 차이를 보였습니다. 특히 GLM-5.3-Flash는 스캔 문서, 사진, 스크린샷 등 이미지 입력도 같은 방식으로 판별할 수 있어, 텍스트만 지원하는 Jev나 Laya와 차별점을 가집니다. 스캔 문서 분류에서는 70.2%의 정확도를 기록했으며, 이미지 처리를 포함한 결정 100만 건당 비용은 약 270유로로 책정되었습니다.
이러한 접근 방식은 대량의 정형 의사결정이 필요한 기업 환경에서 LLM의 활용성을 크게 높일 수 있습니다. 기존 LLM의 느린 속도와 높은 비용 문제를 해결하면서도, 모델의 확신도(confidence score)를 함께 제공하여 사람의 검토가 필요한 경우를 효과적으로 선별할 수 있습니다. 예를 들어, 낮은 확신도를 보이는 결정은 자동으로 사람에게 전달하여 오류를 줄이는 데 활용할 수 있습니다. 또한, 추가 학습 없이 기존 모델을 활용한다는 점은 개발 및 배포 비용을 절감하고, 다양한 산업 분야에서 LLM 기반 의사결정 시스템을 빠르게 도입할 수 있는 기반을 마련합니다. 이는 특히 고객 서비스, 법률 검토, 문서 분류 등 반복적이고 정형화된 판단이 필요한 영역에서 큰 파급력을 가질 것으로 예상됩니다.