최근 오픈소스 도구 스트라타(Strata)가 1,250억 매개변수에 달하는 대규모 언어모델(LLM)인 Qwen3.8-Flash-Next를 일반 소비자용 PC에서 초당 100토큰 이상의 속도로 구동하는 획기적인 기술을 공개했습니다. 이는 고성능 서버 없이도 개인용 컴퓨터에서 대규모 AI 모델을 활용할 수 있는 가능성을 열어주며, 대화, 코드 작성, 이미지 읽기, 코딩 에이전트 연동 등 다양한 기능을 지원합니다.
스트라타는 모델의 방대한 매개변수를 GPU, RAM, CPU, SSD 등 PC의 모든 자원에 분산하여 처리하는 독특한 아키텍처를 사용합니다. 특히 자주 사용되는 모델의 일부(전문가)는 GPU에 상주시키고, 나머지는 RAM과 CPU가 병렬 처리하며, 대형 조회 테이블은 SSD에 저장하는 방식입니다. 또한, 작은 보조 모델이 다음 단어를 예측하면 큰 모델이 이를 검증하여 같은 답변을 1.6~1.8배 빠르게 생성하는 '보조 모델 예측 및 큰 모델 검증' 기법을 적용해 효율성을 높였습니다. 실측 결과, RTX 4090 환경에서 초당 124토큰, RTX 5070 12GB 환경에서는 Q2_0 모델 기준으로 초당 94토큰의 답변 생성 속도를 기록했습니다. 최소 요구 사양은 VRAM 12GB 이상, RAM 32GB 이상입니다.
이러한 기술 발전은 고가의 클라우드 서비스나 전문 워크스테이션 없이도 대규모 언어모델을 개인 환경에서 활용할 수 있게 함으로써 AI 접근성을 크게 향상시킵니다. 특히 데이터가 PC 외부로 나가지 않아 보안 및 개인 정보 보호 측면에서 큰 이점을 제공하며, 개발자나 1인 창업가들이 비용 부담 없이 AI 기반 애플리케이션을 개발하고 테스트할 수 있는 기반을 마련합니다. OpenAI 호환 API 등을 통해 기존 앱 및 코딩 도구와 쉽게 연동할 수 있어 활용 범위가 넓다는 점도 주목할 만합니다. 이는 AI 기술의 민주화와 함께 새로운 서비스 및 비즈니스 모델 창출에 기여할 것으로 기대됩니다.