최근 '슬롯스트림(slotstream)'이라는 새로운 오픈소스 프로젝트가 104GB에 달하는 대규모 언어모델(LLM)인 Qwen3.8-Flash-Next를 48GB 램을 가진 맥(Mac)에서 초당 약 12토큰(token/s)의 속도로 구동하는 데 성공하며 주목받고 있습니다. 이는 일반적으로 100GB 이상의 메모리가 필요한 모델을 저사양 개인용 컴퓨터에서도 효율적으로 실행할 수 있게 하는 획기적인 발전입니다.
슬롯스트림은 1250억 개의 매개변수를 가진 혼합 전문가(Mixture-of-Experts, MoE) 모델인 Qwen3.8-Flash-Next를 4비트 양자화(4-bit quantization)하여 디스크에 104GB로 저장한 후, 전문가 오프로딩(expert-offloading)과 SSD 스트리밍 기술을 활용해 메모리 제약을 극복합니다. 이 도구는 스위프트(Swift) 언어로 개발된 맥 네이티브(Mac-native) 바이너리로, 파이썬(Python) 없이도 설치 및 업데이트가 간편하며, Ollama 및 OpenAI 채팅 API를 지원하여 기존 개발 도구들과의 호환성이 뛰어납니다. 예를 들어, 48GB 램을 가진 맥북 프로(M5 Pro 기준)에서 약 32GB의 피크 메모리 사용량으로 12토큰/초의 속도를 보였으며, 16GB 램 맥에서도 4토큰/초의 속도를 달성할 수 있습니다.
이러한 기술은 대규모 AI 모델의 접근성을 획기적으로 높여, 고가의 GPU 서버 없이도 개인 개발자나 소규모 팀이 로컬 환경에서 복잡한 AI 모델을 실험하고 개발할 수 있는 길을 열어줍니다. 특히 애플 실리콘(Apple Silicon) 맥 사용자들에게는 강력한 온디바이스(on-device) AI 개발 환경을 제공하며, 클라우드 비용 부담 없이 AI 애플리케이션을 구축할 수 있는 기회를 제공합니다. 이는 AI 모델 개발 및 배포의 민주화를 가속화하고, 새로운 형태의 개인용 AI 도구 및 서비스 출현에 기여할 것으로 기대됩니다.