크루소(Crusoe)가 대규모 언어모델(LLM)의 토큰화(tokenization) 과정을 혁신적으로 가속화하는 새로운 오픈소스 라이브러리 '패스토큰(fastokens)'을 발표했습니다. 이 기술은 LLM의 추론(inference) 속도를 저해하는 주요 병목 중 하나인 토큰화 단계를 최대 2배 빠르게 처리하여, 전체 LLM 워크로드의 효율성을 크게 높일 수 있습니다. 이는 특히 최신 프론티어 모델을 활용하는 기업과 개발자에게 중요한 성능 개선을 제공할 것입니다.
패스토큰은 기존 토크나이저(tokenizer)들이 파이썬(Python) 기반으로 작동하며 발생하는 성능 한계를 극복하기 위해 Rust 언어로 재구현되었습니다. Rust는 메모리 관리와 병렬 처리(parallel processing)에 강점을 가진 언어로, 이를 통해 토큰화 과정에서 발생하는 오버헤드(overhead)를 최소화하고 CPU 활용도를 극대화합니다. 크루소는 패스토큰이 Llama-2, Mixtral, Falcon 등 주요 LLM 모델에서 기존 토크나이저보다 1.5배에서 최대 2배 빠른 속도를 보였다고 밝혔습니다. 또한, 이 라이브러리는 허깅페이스(Hugging Face)의 토크나이저 라이브러리와 완벽하게 호환되어 기존 시스템에 쉽게 통합할 수 있습니다.
이러한 토큰화 속도 개선은 LLM 운영 비용 절감과 사용자 경험 향상에 직접적인 영향을 미칩니다. 추론 속도가 빨라지면 더 많은 요청을 동시에 처리할 수 있어 컴퓨팅 자원 활용 효율이 높아지고, 이는 곧 서비스 제공 비용 감소로 이어집니다. 또한, 사용자 입장에서는 LLM 응답 시간을 단축하여 더욱 원활하고 즉각적인 상호작용이 가능해집니다. 패스토큰은 LLM 기술이 다양한 산업 분야에 더욱 깊이 침투하고 확산되는 데 기여할 중요한 기반 기술이 될 것으로 보입니다.