UC 버클리 연구진과 한국의 AI 반도체 스타트업 퓨리오사AI가 대규모 언어모델(LLM) 서비스의 효율성을 극대화하는 혁신적인 기술, HBF(Hybrid Block-wise Fine-grained) 스케줄러를 공동 개발했습니다. 이 기술은 LLM 추론(inference) 과정에서 발생하는 GPU 병목 현상을 해결하여, 기존 방식보다 훨씬 높은 처리량과 낮은 지연 시간을 제공하는 것이 핵심입니다.
HBF 스케줄러는 LLM 추론 시 여러 사용자 요청을 동시에 처리할 때 발생하는 메모리 단편화와 비효율적인 GPU 활용 문제를 개선합니다. 기존 스케줄러는 배치(batch) 단위로 요청을 처리하거나, 토큰(token) 단위로 세밀하게 제어하는 방식이었지만, HBF는 이 두 가지 접근 방식을 하이브리드로 결합하여 장점만을 취합니다. 즉, 요청들을 블록(block) 단위로 묶어 효율적으로 메모리에 할당하면서도, 각 블록 내에서는 토큰 생성을 세밀하게 제어하여 GPU 유휴 시간을 최소화하는 방식입니다. 이를 통해 GPU 활용률을 획기적으로 높여, 동일한 하드웨어에서 최대 2배 빠른 처리 속도를 달성할 수 있습니다.
이러한 기술 발전은 LLM 기반 서비스의 상용화에 매우 중요한 의미를 가집니다. LLM 추론 비용은 서비스 제공자에게 큰 부담으로 작용하는데, HBF와 같은 기술은 GPU 자원을 더욱 효율적으로 사용하여 이 비용을 크게 절감할 수 있게 합니다. 이는 더 많은 기업이 LLM 기반 서비스를 도입하고, 최종 사용자에게는 더 빠르고 저렴한 AI 경험을 제공할 수 있는 기반이 됩니다. 특히 한국의 퓨리오사AI가 글로벌 연구 기관과 협력하여 이러한 핵심 기술 개발에 참여했다는 점은 국내 AI 반도체 기술력의 위상을 높이는 사례로 평가됩니다.