Experiential Labs가 AI 에이전트의 운영 비용을 혁신적으로 줄일 수 있는 오픈소스 도구 'World Model Optimizer(WMO)'를 출시했습니다. WMO는 에이전트가 상호작용하며 생성하는 추적(trace) 데이터를 활용해 대규모 언어모델(LLM)의 사용을 최적화하고, 이를 통해 비용을 40% 이상 절감하면서도 최신 모델(frontier model) 수준의 품질을 유지할 수 있도록 돕습니다.
WMO의 핵심 기능 중 하나는 'wmo serve'입니다. 이 기능은 에이전트의 반복적인 작업을 더 작고 효율적인 모델로 자동 라우팅하여 불필요한 LLM 호출을 줄입니다. 또한, 오픈소스 모델을 활용한 모델 증류(distillation)를 통해 특정 작업에 특화된 소형 모델을 지속적으로 개선하고, 토큰 압축(token compaction)으로 불필요한 정보를 제거해 비용을 추가로 절감합니다. 개발자는 WMO CLI를 통해 모델 제공자를 등록하고, 에이전트의 OTel(OpenTelemetry) 추적 데이터를 기반으로 라우팅 정책을 튜닝하여 최적화된 엔드포인트를 구축할 수 있습니다.
이러한 접근 방식은 AI 에이전트 개발 및 운영의 효율성을 크게 향상시킬 수 있습니다. 특히, LLM 사용량이 증가하면서 발생하는 높은 추론(inference) 비용은 많은 기업과 개발자에게 부담으로 작용하고 있습니다. WMO는 이러한 비용 문제를 해결하는 동시에, 에이전트의 성능을 지속적으로 개선할 수 있는 프레임워크를 제공하여 AI 기술의 상업적 활용 가능성을 넓히는 데 기여할 것으로 보입니다. 이는 AI 에이전트가 더욱 광범위하게 적용될 수 있는 기반을 마련하며, 개발자들이 비용 부담 없이 혁신적인 AI 서비스를 구축할 수 있도록 지원할 것입니다.