최근 발표된 연구에 따르면, 대규모 언어모델(LLM)을 기반으로 하는 인공지능 에이전트 시스템에서 보조적인 '마이크로태스크(microtask)'를 처리하기 위해 소형 언어모델(SLM)을 활용하려는 시도가 아직은 한계가 있는 것으로 나타났습니다. 쉘 명령어 승인, 메모리 작성, 도구 선택, 과거 대화 순위 지정 등 다양한 마이크로태스크에서 상용 SLM들이 기대했던 성능 기준을 충족하지 못한다는 것이 핵심 내용입니다.
이 연구는 Qwen3 0.6B부터 8B까지, 그리고 Llama-3.x 모델들을 대상으로 4가지 마이크로태스크 벤치마크를 구축하여 평가했습니다. 각 태스크에는 저렴한 비(非)LLM 기준선에 맞춰 설정된 성능 임계값(threshold)이 있었는데, 놀랍게도 16가지 Qwen3 구성(4개 태스크 × 4개 모델) 중 단 하나도 이 임계값을 넘지 못했습니다. Llama-3.x 모델 역시 12개 구성 모두 기준에 미달했습니다. 이는 모델의 크기가 커질수록 성능이 향상되긴 하지만, 양자화(quantization) 여부와 관계없이 SLM 자체의 역량 부족이 주요 원인으로 지목되었습니다.
이번 연구 결과는 LLM 에이전트 시스템을 설계할 때 SLM의 역할에 대한 현실적인 기대를 갖게 합니다. 단순히 비용 절감이나 효율성만을 위해 SLM을 마이크로태스크에 무작정 적용하기보다는, 먼저 비(非)LLM 기준선이 충족되는지 확인하고, SLM은 기준선이 실패하는 특정 영역에서만 보조적으로 활용하는 전략이 필요하다는 실용적인 시사점을 제공합니다. 예를 들어, BM25와 같은 기존 검색 모델의 결과를 SLM이 재순위화(re-rank)하는 방식은 성능 향상에 기여할 수 있지만, SLM 단독으로 전체 태스크의 자격 기준을 충족하기는 어렵다는 것입니다.
