알리바바 클라우드의 콴원(Qwen) 팀이 차세대 대규모 언어모델(LLM) Qwen4 아키텍처를 기반으로 하는 멀티모달 전문가 혼합(MoE) 모델인 Qwen 3.8-Flash-Next를 2026년 8월 26일 공개할 예정입니다. 이번 출시는 Qwen4 모델군이 정식으로 공개되기 전에 커뮤니티가 새로운 아키텍처와 개선 사항을 미리 경험하고 대비할 수 있도록 돕기 위한 목적이 큽니다. 기본 모델과 함께 FP8 버전도 제공될 예정이며, 공개 시점부터 ModelScope와 Hugging Face 페이지에서 접근할 수 있습니다.
Qwen 3.8-Flash-Next는 125B 매개변수와 6B의 활성 매개변수를 가진 MoE 모델로, 기존 Qwen 모델들의 성능을 뛰어넘을 것으로 기대됩니다. 특히 로컬 환경에서 대규모 언어모델을 실행하려는 사용자들 사이에서 큰 관심을 받고 있습니다. 128GB 램을 탑재한 Strix Halo 같은 고성능 개인 장치나 새로운 Mac Studio 등에서 120B 이상의 대규모 모델을 효율적으로 실행할 수 있을지에 대한 논의가 활발하며, FP8 양자화를 통해 메모리 효율성과 추론 속도를 개선할 수 있을지 주목됩니다. 현재 Qwen 3.8 27B 모델도 64GB 램을 쉽게 소진하는 만큼, 이번 신규 모델의 하드웨어 요구 사항과 성능에 대한 기대와 우려가 공존하고 있습니다.
이번 Qwen 3.8-Flash-Next의 출시는 단순히 새로운 모델을 선보이는 것을 넘어, 향후 Qwen4 모델군의 생태계 구축에 중요한 이정표가 될 것으로 보입니다. 커뮤니티가 미리 아키텍처를 검증하고 추론 스택 호환성을 확보할 수 있게 함으로써, Qwen4 정식 출시 시점에는 더 안정적이고 광범위한 지원을 기대할 수 있습니다. 이는 로컬 AI 개발자와 사용자들에게 더 강력하고 효율적인 도구를 제공하며, 대규모 언어모델의 접근성과 활용성을 높이는 데 기여할 것입니다. 또한, DeepSeek V4 Flash와 같은 경쟁 모델들과의 비교를 통해 전체 AI 모델 시장의 기술 발전과 혁신을 촉진할 것으로 예상됩니다.