최근 진행된 대규모 언어모델(LLM) 벤치마크 테스트에서 GLM-5.3 오픈 웨이트 모델이 놀라운 성과를 보였습니다. 28가지 실무 과제를 100% 통과하며 품질 점수 9.3을 기록했고, 전체 실행 비용은 약 0.28달러로, GPT-5.5의 약 5분의 1 수준에 불과해 비용 효율성 측면에서 압도적인 우위를 점했습니다. 이는 학술적 지표보다는 실제 사용자가 직면하는 문제 해결 능력에 초점을 맞춘 평가 결과입니다.
이번 평가는 17개 주요 LLM에 동일한 프롬프트(prompt)와 API 호출, OpenRouter 스트리밍 경로를 적용하고 결정론적 자동 채점 방식을 사용했습니다. 평가 항목은 코딩(Coding), 데이터(Data), 실세계(Realworld), 보안(Security), 도구 사용(Tool-use) 등 실제 업무와 밀접한 5가지 카테고리로 구성되었으며, 각 모델의 통과율, 품질 루브릭, 첫 토큰 시간(TTFT), 그리고 과제당 비용을 종합적으로 비교했습니다. GLM-5.3은 모든 카테고리에서 100% 통과율을 달성한 유일한 모델로, 특히 다른 모델들이 취약점을 보인 실세계 및 보안 과제에서도 뛰어난 성능을 입증했습니다.
이러한 결과는 대규모 언어모델을 활용하려는 기업이나 개발자들에게 중요한 시사점을 제공합니다. 고성능 모델의 높은 운영 비용이 부담스러웠던 상황에서, GLM-5.3과 같은 비용 효율적인 오픈 웨이트 모델의 등장은 LLM 도입 장벽을 크게 낮출 수 있습니다. 특히 1인 개발자나 스타트업이 제한된 예산으로도 고품질의 AI 서비스를 구축하고 운영할 수 있는 기회를 열어줄 것으로 기대됩니다. 다만, GLM-5.3의 첫 토큰 생성 시간(TTFT)이 16.3초로 상대적으로 느리다는 점은 실시간 응답이 중요한 대화형 애플리케이션 등에서는 고려해야 할 부분입니다.