새로운 대규모 언어모델(LLM) 추론 엔진 '리플렉스(Reflex)'가 콜드 스타트(cold start) 성능에서 기존의 인기 엔진들을 크게 앞지르며 AI 커뮤니티의 이목을 끌고 있습니다. 리플렉스는 프로세스 시작부터 첫 결과가 나오기까지의 시간을 의미하는 콜드 스타트 최적화에 집중하여, '라마.cpp(llama.cpp)'나 'vLLM' 같은 경쟁자들을 능가하는 속도를 보여줍니다. 이는 특히 서버리스 GPU 환경에서 AI 애플리케이션의 비용 효율성과 사용자 경험을 혁신할 잠재력을 가집니다.
리플렉스의 핵심 비결은 모든 CUDA 커널을 미리 컴파일하여 바이너리에 포함시키는 'AOT(Ahead-Of-Time) 컴파일' 방식에 있습니다. 덕분에 프로세스 시작 시점에 JIT(Just-In-Time) 컴파일이 필요 없어 시작 지연이 거의 없습니다. 테슬라 T4 GPU에서 Qwen3-0.6B-Q4_K_M 모델을 기준으로, 리플렉스는 약 483ms의 콜드 스타트 시간을 기록했으며, 외부 측정 시 OS 시작 시간을 포함해도 약 0.6초에 불과했습니다. 이는 vLLM이 동일 환경에서 39.8초에서 127.3초가 걸리는 것과 비교하면 최대 150배 빠른 수치입니다. 리플렉스는 단일 요청 처리에 최적화된 아키텍처를 가지며, 스케줄러나 배치 처리 없이 한 번에 하나의 요청을 처리하는 '싱글 테넌트' 방식입니다. HTTP 통신은 별도의 사이드카(sidecar)를 통해 로컬 IPC(Inter-Process Communication)로 이루어집니다.
이러한 콜드 스타트 성능은 서버리스 GPU 플랫폼의 비용 구조와 직결됩니다. 서버리스 환경에서는 GPU 인스턴스가 활성화되어 요청을 처리할 준비가 되기까지의 모든 시간이 과금되기 때문에, 시작 시간이 길수록 비용 부담이 커집니다. 리플렉스는 도구 호출(tool call), 분류(classification), 정보 추출(extraction)과 같이 단발성(bursty), 단일 작업(single-shot)이 많은 AI 애플리케이션에 특히 유리합니다. 개발자들은 리플렉스를 통해 더 빠르고 저렴하게 AI 기능을 배포하고 운영할 수 있게 되어, 새로운 AI 서비스와 비즈니스 모델을 탐색할 기회를 얻을 수 있습니다. 또한, 에너지 효율성 측면에서도 콜드 스타트 시 GPU의 유휴 전력 소모를 줄여 약 5.4J의 낮은 에너지 비용을 보여줍니다.