최근 공개된 연구에 따르면, 대규모 언어모델(LLM) 에이전트의 의사결정 과정을 가속화하고 비용을 절감할 수 있는 '시스템-1' 의사결정 모델의 실제 성능이 기대에 못 미치는 것으로 나타났습니다. 시스템-1 모델은 LLM 에이전트가 어떤 모델을 호출할지, 어떤 도구를 사용할지, 검색된 텍스트가 관련성이 있는지 등 작은 결정을 내릴 때, LLM을 직접 호출하는 대신 단일 추론(inference) 패스로 빠르게 답을 제공하는 방식입니다. 이는 상당한 비용 및 지연 시간(latency) 절감을 약속하며 주목받아 왔습니다.
이번 연구에서는 오픈소스 모델인 '라야(Laya)'와 호스팅 모델인 '제브(Jev)' 두 가지 시스템-1 모델을 11가지 에이전트 의사결정 지점(decision points)에서 평가했습니다. 18개 공개 소스에서 추출한 7,283개의 기본 사례와 6,640개의 견고성(robustness) 변형을 포함한 방대한 데이터셋을 사용했습니다. 평가 결과, 제브는 11개 의사결정 지점 중 9개에서 라야보다 현저히 높은 정확도(10.8%p ~ 46.0%p)를 보였습니다. 하지만 두 모델 모두 제로샷(zero-shot) 모델 라우팅에서는 무작위 선택보다 나은 성능을 보이지 못했으며, 검색 증강 생성(RAG) 관련성 게이팅에서는 동등한 성능을 기록했습니다. 특히 라야는 옵션 순서가 바뀌면 30%의 답변이 달라지고, 후보군이 많거나 유사할 경우 정확도가 급격히 떨어지는 등 견고성에서 큰 약점을 드러냈습니다.
연구팀은 자체 평가 파이프라인에 대한 감사(self-audit)도 진행했는데, 여기서 몇 가지 분석 오류와 설계상 혼란(design confound)이 발견되었습니다. 예를 들어, 초기 보고된 23.9%의 비용 절감 효과는 사전 심사(pre-screen) 비용을 누락하여 실제로는 4.3%에 불과했으며, 게이트 정확도(gate accuracy)가 최종 품질(end-to-end quality)로 잘못 보고된 사례도 있었습니다. 이는 시스템-1 모델이 이론적으로는 매력적이지만, 실제 배포 환경에서는 예상치 못한 복잡성과 한계가 있음을 시사합니다. 따라서 LLM 에이전트 개발 시 시스템-1 모델의 도입을 고려한다면, 비용 절감 및 성능 향상 효과에 대한 면밀하고 현실적인 평가가 필수적입니다.