알리바바(Alibaba)가 최근 공개한 오픈 가중치 대규모 언어모델(LLM) Qwen3.8 27B가 인공지능 분석(Artificial Analysis)의 지능 지수(Intelligence Index) 평가에서 52점이라는 놀라운 성과를 기록했습니다. 이는 비슷한 규모의 오픈 가중치 모델 중앙값인 9점을 훨씬 웃도는 수치로, 소형 모델(4B~40B 매개변수) 부문에서 독보적인 성능을 보여주며 업계의 주목을 받고 있습니다.
Qwen3.8 27B는 270억 개의 매개변수(parameter)를 가진 추론 모델로, 텍스트와 이미지를 동시에 입력받아 텍스트를 출력하는 멀티모달(multimodal) 기능을 지원합니다. 특히 복잡한 문제에 답하기 전에 확장된 사고(chain-of-thought) 또는 연쇄적 사고(tree-of-thought)를 수행하는 추론 능력이 강화된 버전입니다. 아파치 2.0(Apache 2.0) 라이선스로 가중치가 공개되어 누구나 허깅 페이스(Hugging Face)에서 내려받아 자체 호스팅 및 상업적 이용이 가능합니다. 평가 과정에서 1억 6천만 토큰(token)에 달하는 방대한 출력을 생성했는데, 이는 동급 모델 중앙값인 4천3백만 토큰보다 훨씬 많은 양입니다. 컨텍스트 창(context window)은 256k 토큰으로, 이는 A4 용지 약 384쪽에 해당하는 분량입니다.
이번 평가 결과는 소형 모델이 최첨단(state-of-the-art) 모델에 근접하는 지능을 가질 수 있음을 보여주며, 대규모 데이터센터 구축의 필요성에 대한 의문을 제기합니다. 사용자들은 Qwen3.8 27B가 문제 해결에 있어 매우 집요하고 창의적인 접근 방식을 보이며, 때로는 GPT-5.6-Sol-max와 같은 최상위 모델과 유사한 수준의 추론 능력을 보여준다고 평가합니다. 이는 제한된 자원으로도 고성능 AI를 구축하고 활용할 수 있는 가능성을 열어주어, AI 기술의 민주화와 확산에 크게 기여할 것으로 기대됩니다. 다만, 많은 출력 토큰 사용량과 아직 공개되지 않은 속도 및 작업당 비용은 실제 활용 시 고려해야 할 부분입니다.