인공지능(AI) 모델 경량화 솔루션 기업 언슬로스(Unsloth)가 알리바바(Alibaba)의 대규모 언어모델(LLM)인 Qwen3.8-2.4T-A95B 모델을 혁신적으로 압축하여 로컬 환경에서 실행할 수 있도록 지원합니다. 기존 BF16 정밀도 기준 4.89테라바이트(TB)에 달하던 이 모델의 크기를, 독자적인 다이내믹 1-비트(Dynamic 1-bit) 양자화(quantization) 기술을 적용해 397기가바이트(GB)까지 줄였습니다. 이는 원본 대비 약 91%에 달하는 놀라운 크기 감소입니다.
언슬로스는 1-비트부터 8-비트, 그리고 BF16까지 다양한 양자화 버전을 제공하며, 2-비트 버전은 약 657GB, 3-비트는 956GB, 4-비트는 1.31TB 수준으로 크기를 줄였습니다. 특히 모든 레이어를 균일하게 압축하는 대신, 모델의 성능에 중요한 영향을 미치는 레이어는 더 높은 정밀도를 유지하는 '언슬로스 다이내믹 양자화' 방식을 사용했습니다. Qwen3.8-2.4T-A95B는 전체 2.4조 개의 파라미터(parameter) 중 토큰당 950억 개를 활성화하는 MoE(Mixture-of-Experts) 모델로, 양자화된 버전이라도 일반 개인용 PC보다는 수백 GB의 메모리를 갖춘 고사양 워크스테이션에서 구동하는 것을 목표로 합니다. 언슬로스 데스크톱(Unsloth Desktop)을 통해 맥(Mac), 윈도우(Windows), 리눅스(Linux) 환경에서 실행 가능하며, 램(RAM) 오프로딩 및 멀티 GPU 구성도 지원합니다.
이번 발표는 데이터센터급 대규모 언어모델의 접근성을 워크스테이션 수준으로 확장했다는 점에서 큰 의미를 가집니다. 개발자들은 이제 라마.cpp(llama.cpp), 올라마(Ollama), LM 스튜디오(LM Studio), vLLM, SGLang 등 다양한 도구를 통해 Qwen3.8 모델을 로컬에서 실행하거나, 자체 API 서버를 구축하여 파이(Pi), 오픈클로(OpenClaw), 헤르메스(Hermes)와 같은 에이전트 도구의 백엔드로 활용할 수 있게 되었습니다. 이는 대규모 모델을 활용한 새로운 애플리케이션 개발과 연구에 박차를 가할 것으로 예상됩니다. 한편, Qwen 개발팀은 이번 주 중으로 Qwen3.8-27B 모델을 공개할 예정이어서, 개인 사용자를 위한 더욱 현실적인 선택지가 될 것으로 보입니다.