데이터베이스 Redis의 창시자로 잘 알려진 안티레즈(Antirez)가 로컬 환경에서 대규모 언어모델(LLM)을 효율적으로 구동할 수 있는 추론 엔진 ‘ds4’를 공개했습니다. ds4는 고성능 Mac, CUDA 및 ROCm 기반 시스템에 최적화되어 있으며, DeepSeek V4/V4.1 Flash, GLM 5.x, Qwen3.8 Flash Next 등 특정 개방형 모델을 지원합니다. 이는 원격 서버에 의존하지 않고 개인 기기에서 강력한 AI 모델을 직접 실행할 수 있는 새로운 가능성을 제시합니다.
ds4의 핵심은 ‘비대칭 2비트 양자화(Asymmetric 2-bit quantization)’ 기술과 ‘디스크 기반 KV 캐시(KV cache as a disk citizen)’입니다. 비대칭 양자화는 모델의 핵심 경로를 정밀하게 유지하면서 라우팅된 전문가(routed experts) 부분만 압축하여, 2840억 개 매개변수에 달하는 DeepSeek V4 Flash 같은 대규모 모델도 고메모리 머신에서 실용적으로 구동 가능하게 합니다. 또한, 디스크 기반 KV 캐시는 긴 프롬프트(prompt) 접두사를 SSD에 저장하고 해시(hash) 값으로 재활용하여, 시스템 재시작 시에도 전체 재계산 없이 빠르게 추론을 재개할 수 있도록 돕습니다. ds4는 CLI, HTTP API, 그리고 코딩 세션을 위한 네이티브 에이전트 등 세 가지 인터페이스를 제공하여 개발자들이 다양한 방식으로 활용할 수 있습니다.
이러한 로컬 추론 엔진의 등장은 AI 개발 및 활용 방식에 중요한 변화를 가져올 수 있습니다. 특히 데이터 프라이버시가 중요한 환경이나 인터넷 연결이 불안정한 상황에서 강력한 LLM을 활용할 수 있게 됩니다. 또한, 개인 개발자나 소규모 팀이 고가의 클라우드 GPU 자원 없이도 대규모 모델을 실험하고 애플리케이션에 통합할 수 있는 문을 열어줍니다. ds4는 특정 모델에 집중하고 최적화함으로써 범용 GGUF(GGML Unified Format) 러너와 차별화되며, 이는 로컬 AI 생태계의 다양성과 효율성을 높이는 데 기여할 것으로 보입니다.