프리즘ML(PrismML)의 초경량 1비트/3진(ternary) 본사이(Bonsai) 모델이 DDR4 메모리 타이밍 규칙을 파괴하며 DRAM(Dynamic Random-Access Memory) 내부에서 성공적으로 구동되는 실험이 진행되어 업계의 주목을 받고 있습니다. 이는 스마트폰과 같은 엣지 기기에서 대규모 언어모델(LLM)을 효율적으로 실행할 수 있는 새로운 가능성을 제시하며, 애플(Apple) 등 주요 스마트폰 제조사들이 온디바이스 AI를 어떻게 구현할지 관심이 집중되고 있습니다.
온디바이스 AI는 사용자 프라이버시를 보장하고, 값비싼 클라우드 추론(inference) 비용을 절감하며, 진정한 AI 기능을 갖춘 하드웨어 업그레이드 주기를 촉진하는 필수적인 전략입니다. 스마트폰에서 270억 개 이상의 매개변수(parameter)를 가진 LLM을 구동하려면 모델 경량화와 함께 메모리 접근 방식의 혁신이 필수적입니다. 이번 실험은 DRAM의 기존 동작 방식을 벗어나 모델을 메모리 자체에 더 가깝게 배치함으로써, 데이터 전송 지연을 최소화하고 전력 효율성을 극대화하려는 시도로 풀이됩니다. 특히, 1비트 또는 3진 모델은 기존 부동소수점 모델보다 훨씬 적은 메모리와 연산 능력을 요구하여 엣지 기기에 적합합니다.
이러한 기술 발전은 '스마트 온디바이스 시맨틱 라우터(Semantic Router)'와 같은 고급 AI 기능을 스마트폰에서 직접 구현할 수 있는 기반을 마련합니다. 이는 사용자가 클라우드 연결 없이도 복잡한 AI 작업을 수행하고, 개인화된 경험을 누릴 수 있게 함으로써 AI 활용의 패러다임을 바꿀 수 있습니다. 궁극적으로는 새로운 하드웨어 슈퍼사이클을 촉발하여 AI 시대에 걸맞은 새로운 컴퓨팅 환경을 조성하고, 엣지 기기에서의 AI 경쟁을 심화시킬 중요한 전환점이 될 것입니다.