최근 AI 개발자들 사이에서 다양한 대규모 언어모델(LLM)을 효율적으로 관리하고 최적화하는 것이 중요한 과제로 떠오르고 있습니다. 이러한 요구에 맞춰, 오픈소스 모델 게이트웨이 '익스페리엔셜(Experiential)'이 공개되어 주목받고 있습니다. 이 게이트웨이는 자체 호스팅 모델, 최신 상용 모델, 오픈소스 모델 등 모든 종류의 AI 모델을 한곳에서 관리할 수 있는 단일 인터페이스를 제공합니다.
익스페리엔셜은 Rust 기반으로 개발되어 높은 동시성(concurrency)을 자랑하며, 다양한 모델과 제공업체(OpenAI, Anthropic, Gemini, Azure 등)의 복잡한 설정(스트리밍 형식, 도구 호출, 모델 매개변수, 속도 제한, 오류 처리 등)을 통합 처리합니다. 이를 통해 개발자는 여러 API를 개별적으로 다룰 필요 없이, OpenAI 호환 API 하나로 모든 모델에 접근할 수 있습니다. 특히, 사용자 지정 키(BYOK) 요청 시 1밀리초 미만, 익스페리엔셜이 제공하는 키 사용 시 2밀리초 미만의 낮은 지연 시간(latency)을 제공하여 성능 저하 없이 모델을 활용할 수 있습니다. 또한, 매일 1,000개 이상의 모델 정보를 자동으로 업데이트하여 최신 모델들을 항상 지원합니다.
익스페리엔셜의 핵심 기능 중 하나는 사용량 데이터를 기반으로 모델 라우팅을 최적화하는 것입니다. 에이전트 워크플로우에서 발생하는 OpenTelemetry 추적(trace) 데이터를 수집하여, 품질, 속도, 비용 측면에서 가장 효율적인 모델 또는 라우터를 구축할 수 있도록 돕습니다. 이는 개발자가 특정 작업에 가장 적합한 모델을 자동으로 선택하거나, 비용 효율적인 모델을 우선적으로 사용하도록 설정하여 운영 비용을 절감하는 데 크게 기여할 수 있습니다. 이러한 기능은 AI 애플리케이션의 성능을 향상시키고, 복잡한 모델 관리 부담을 줄여 개발 생산성을 높이는 데 중요한 역할을 할 것으로 기대됩니다.