모바일 기기에서 대규모 언어모델(LLM)을 직접 실행하는 온디바이스(on-device) 추론은 사용자 데이터 보호, 오프라인 작동, 비용 절감 등 여러 장점이 있습니다. 하지만 발열(thermal) 문제는 온디바이스 LLM의 치명적인 약점으로 꼽힙니다. 최근 연구에 따르면, 플래그십 스냅드래곤(Snapdragon) 기기에서 LLM을 연속으로 구동하면 GPU 추론 런타임이 불안정해져 충돌하거나 멈추는 현상이 발생하며, 이는 단순한 속도 저하를 넘어선 심각한 문제입니다.
이러한 문제를 해결하기 위해 '하이브리드인퍼(HybridInfer)'라는 새로운 강화 학습(reinforcement learning) 기반 라우터가 개발되었습니다. 하이브리드인퍼는 온디바이스(Llama 3.2 3B), 엣지(Llama 3.1 8B), 클라우드(GPT-4o) 세 가지 추론 계층 중 하나를 선택합니다. 특히, 이 시스템은 휴대폰의 발열 여유 공간(thermal headroom)과 쿼리 복잡도 추정치를 상태 정보로 활용하며, 오프라인으로 학습된 Q-러닝(Q-learning) 정책을 통해 계층을 선택합니다. 보상 함수는 품질, 지연 시간(latency), 비용, 발열 페널티를 고려하며, 온디바이스 실행에 대한 로컬리티 보너스(locality bonus)를 부여하여 발열 인지 라우팅의 전제 조건을 마련했습니다. 삼성 갤럭시 S25+ (스냅드래곤 8 엘리트) 실제 안드로이드 기기에서 210개 프롬프트로 벤치마크한 결과, 하이브리드인퍼는 기존 수동 튜닝 방식보다 훨씬 높은 품질을 달성하면서도 가장 낮은 비용을 기록했습니다.
이 연구는 온디바이스 LLM 추론의 실질적인 한계를 극복하고, 모바일 기기에서 AI를 더욱 안정적이고 효율적으로 활용할 수 있는 길을 열었다는 점에서 중요합니다. 기존 방식이 발열로 인해 장문 쿼리에서 실패하거나 매우 느려지는 반면, 하이브리드인퍼는 지연 시간, 신뢰성, 커버리지 측면에서 우위를 보이며, 사용자 경험을 크게 향상시킬 수 있습니다. 이는 실시간 AI 비서, 개인화된 온디바이스 AI 애플리케이션 등 다양한 모바일 AI 서비스의 상용화를 가속화할 잠재력을 가지고 있습니다.
