AI 반도체 전문 기업 세레브라스(Cerebras)가 자사의 퍼블릭 API 엔드포인트를 통해 콴원 3.8 27B(Qwen 3.8 27B) 대규모 언어모델(LLM)을 초당 1,500토큰(tokens/s)이라는 인상적인 속도로 서비스하기 시작했습니다. 이는 개발자들이 고성능 오픈소스 LLM을 활용하여 AI 애플리케이션을 구축할 때 중요한 성능 이점을 제공할 것으로 기대됩니다.
세레브라스는 콴원 3.8 27B 외에도 120억 개의 매개변수를 가진 오픈AI GPT OSS 모델을 초당 3,000토큰 속도로 제공하는 등 다양한 모델을 지원하고 있습니다. 특히, 모든 퍼블릭 엔드포인트 모델은 원본(unpruned) 버전을 사용하며, 품질 유지를 위해 선택적 가중치 전용 양자화(selective weight-only quantization)만 적용합니다. 이는 모델의 아키텍처를 변경하는 가지치기(pruning)와 달리, 데이터 정밀도를 낮춰 메모리 사용량을 줄이면서도 모델의 원래 성능을 최대한 보존하려는 접근 방식입니다.
이러한 고성능 추론 서비스는 개발자들이 자체적으로 고가의 AI 가속기 인프라를 구축할 필요 없이, 클라우드 기반으로 강력한 LLM을 활용할 수 있게 합니다. 특히, 콴원 3.8 27B와 같은 오픈소스 모델의 접근성을 높여, AI 기술의 민주화를 가속화하고 다양한 산업 분야에서 혁신적인 AI 솔루션 개발을 촉진할 수 있을 것입니다. 이는 스타트업이나 개인 개발자에게도 AI 모델 활용의 문턱을 낮춰주는 중요한 의미를 가집니다.