PrismML이 Qwen3.8 27B를 기반으로 한 3진 가중치 대규모 언어모델(LLM)인 'Bonsai 2 27B'를 발표하며, AI 모델 경량화의 새로운 이정표를 세웠습니다. 이 모델은 원본 대비 9분의 1 미만인 5.9GB의 작은 크기에도 불구하고, 종합 벤치마크에서 98.2%에 달하는 뛰어난 성능 유지율을 보이며, 로컬 환경에서의 고성능 AI 활용 가능성을 크게 높였습니다.
Bonsai 2 27B는 가중치를 −1, 0, +1의 세 값과 보정용 배율로 표현하는 3진 가중치 방식을 사용해 가중치당 실효 비트 수를 1.76비트로 낮췄습니다. 이는 이전 Bonsai 세대의 95% 성능 유지율을 98% 이상으로 끌어올린 결과입니다. 특히 코딩, 수학, 지시 따르기 등 다양한 벤치마크에서 원본 모델에 근접하거나 능가하는 성능을 보였으며, 추론(inference), 비전, 장기 에이전트 작업 성능도 개선되었습니다. 예를 들어, NVIDIA RTX 5090 GPU에서는 최대 143토큰/초, M5 Max에서는 46.8토큰/초의 처리량을 기록했으며, RTX 4090에서는 8B 모델보다 40% 높은 에너지 효율을 자랑합니다. 또한 262K 토큰 컨텍스트와 텍스트/이미지 멀티모달 입력을 지원하며, CUDA와 MLX용 저비트 커널을 통해 NVIDIA GPU와 Apple 기기에서 실행 가능합니다. 모델 가중치는 Apache 2.0 라이선스로 공개되어 접근성을 높였습니다.
이러한 경량화 기술은 인공지능 배포의 패러다임을 바꿀 잠재력을 가집니다. 저비트 모델은 로컬 기기, 워크스테이션, 데이터센터의 비용 구조와 아키텍처를 혁신하여, 같은 메모리 용량에 더 큰 모델을 탑재하거나 동일 하드웨어에서 더 많은 사용자에게 서비스를 제공할 수 있게 합니다. 추론당 에너지 소비를 줄여 지속 가능한 AI 운영을 가능하게 하며, 민감한 작업은 로컬에서 처리하고 필요한 경우에만 클라우드로 연동하는 하이브리드 시스템 구현을 촉진합니다. 이는 모델의 절대 성능뿐만 아니라 주어진 자원 제약 내에서 얼마나 유용한 지능을 제공하는지가 중요해지는 현 시대에, 개인 기기부터 대규모 데이터센터까지 AI 모델의 배포 범위를 획기적으로 확장할 핵심 기술로 평가됩니다.