코베닉 AI가 AI 모델의 고질적인 장기 기억(long-term memory) 문제를 해결하는 혁신적인 솔루션 '갈라하드(Galahad)'를 선보였습니다. 갈라하드는 AI 모델이 한 번 처리한 텍스트를 기억하고 필요할 때 다시 제공함으로써, GPU가 동일한 토큰을 반복적으로 읽고 계산하는 비효율을 제거합니다. 이는 특히 대규모 언어모델(LLM)의 운영 비용을 절감하고 추론(inference) 속도를 획기적으로 향상시키는 데 기여할 것으로 기대됩니다.
갈라하드의 핵심은 '탈리에신(Taliesin)'과 '블레이즈(Blaise)'라는 두 가지 구성 요소에 있습니다. 탈리에신은 모델의 KV 캐시(Key-Value cache)를 디스크에 저장하고 복원하여, 이전에 처리된 토큰을 다시 계산할 필요 없이 99.6%의 토큰을 메모리에서 불러옵니다. 이를 통해 vLLM 환경에서 최대 14배 빠른 속도와 질문당 0.59초의 응답 시간을 달성했습니다. 블레이즈는 원본 문서를 정확하게 보관하고 질문과 관련된 핵심 부분만 찾아 모델에 제공함으로써, 9,700 토큰 중 670 토큰만 읽어도 100%의 정확도를 유지합니다. 이는 손실이 발생하는 임베딩(embedding) 기반 RAG(Retrieval-Augmented Generation) 파이프라인과 달리 바이트 단위의 정확성을 보장하며, 최대 5천만 토큰에 달하는 방대한 텍스트를 처리하면서도 GPU 메모리 사용량을 34.1GB로 일정하게 유지하는 '5천만 토큰 컨텍스트 창' 기능을 제공합니다.
이러한 갈라하드의 등장은 AI 애플리케이션 개발 방식에 중대한 변화를 가져올 수 있습니다. 기존 RAG 방식의 낮은 정확도와 높은 비용 문제를 해결하며, 에이전트(agent)의 모든 단계를 기록하고 재생하여 디버깅을 용이하게 하는 기능, 다중 사용자 환경에서 접두사 공유(prefix sharing)와 테넌트(tenant) 분리 기능을 제공하여 효율성과 보안성을 높입니다. 결과적으로 개발자들은 더 길고 복잡한 정보를 다루는 AI 서비스를 구축할 수 있게 되며, 사용자들은 더 빠르고 정확하며 비용 효율적인 AI 경험을 누릴 수 있게 될 것입니다. 이는 AI 모델의 실제 활용 범위를 넓히고, 새로운 형태의 AI 기반 서비스 탄생을 촉진할 잠재력을 가지고 있습니다.