알리바바(Alibaba)의 최신 대규모 언어모델(LLM)인 Qwen3.8 Max가 인공지능(AI) 모델 평가 플랫폼 Artificial Analysis의 Agentic Index에서 종합 1위를 차지하며 에이전트 역량의 선두 주자로 떠올랐습니다. Agentic Index는 AI 에이전트가 도구를 활용하고, 복잡한 문제를 계획하며, 자율적으로 해결하는 능력을 종합적으로 측정하는 지표입니다. 이번 결과는 최첨단 LLM들이 단순 지능을 넘어 실제 업무 환경에서 활용될 수 있는 에이전트 기능 면에서 빠르게 발전하고 있음을 보여줍니다.
Artificial Analysis는 Agentic Index 외에도 다양한 평가 지표를 제공합니다. Intelligence Index v4.1.1은 GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1 등 9가지 평가를 결합하여 모델의 전반적인 지능을 측정하며, 이와 함께 작업당 비용, 실행 시간, 출력 토큰 수 등 실용적인 요소들도 함께 비교합니다. 특히, 코딩 에이전트, 이미지·영상·음성 처리, 모델 개방성, API 속도 및 지연 시간, 제공자별 엔드포인트 정확도 등 세분화된 평가를 통해 사용자가 특정 용도에 맞는 모델을 선택할 수 있도록 돕습니다. Qwen3.8 Max는 8월 5일 평가 대상에 추가된 이후 빠르게 Agentic Index 정상에 올랐습니다.
이번 Qwen3.8 Max의 약진은 대규모 언어모델 시장에서 중국 기술 기업의 경쟁력이 강화되고 있음을 보여주는 동시에, 모델 선택의 기준이 지능 점수 외에 실제 활용성과 경제성으로 확장되고 있음을 의미합니다. 사용자들은 이제 단순히 '가장 똑똑한' 모델을 넘어, 특정 작업에 필요한 에이전트 역량, 합리적인 비용, 빠른 응답 속도, 그리고 모델의 투명성까지 종합적으로 고려하여 최적의 솔루션을 찾아야 합니다. 특히 로컬(local) 환경에서 실행 가능한 소형 모델의 성능 향상은 개인 개발자와 1인 창업자들에게 새로운 기회를 제공할 수 있습니다. 모델들이 특정 지능 수준에 수렴하는 경향을 보이면서, 실제 문제 해결 능력과 효율성이 더욱 중요한 차별화 요소로 부각될 것입니다.