대규모 언어모델(LLM) 기반 서비스를 운영하는 많은 기업들이 더 저렴한 LLM으로 전환하고 싶어 하지만, 모델 변경이 실제 유저 경험에 부정적인 영향을 미쳐 이탈로 이어질까 우려하고 있습니다. 기존에는 벤치마크 점수나 프롬프트 응답 비교를 통해 모델을 선택했지만, 이러한 방식으로는 실제 서비스 환경에서의 유저 행동 변화나 비용 효율성을 정확히 파악하기 어려웠습니다. 이러한 문제를 해결하기 위해 ABTO라는 새로운 LLM A/B 테스트 도구가 등장했습니다.
ABTO는 서비스 트래픽을 여러 LLM에 분산시켜 각 모델의 성능과 비용 효율성을 실제 유저 데이터를 기반으로 비교할 수 있도록 설계되었습니다. 예를 들어, AI 글쓰기 서비스에서 초안 생성 기능에 모델 A와 B를 연결하고, 특정 비율로 트래픽을 나눕니다. 이후 유저가 생성한 초안을 저장하거나 공유하는 행동, 또는 결제와 같은 핵심 지표들을 이벤트로 연결하여 각 모델별 성과를 측정합니다. 이를 통해 단순히 '어느 모델의 답변이 더 좋아 보이는가'를 넘어, '우리 서비스 유저가 어느 모델의 결과를 실제로 자주 사용하는가'를 정량적으로 파악할 수 있습니다. ABTO는 LLM 라우터 기능과 포스트호그(Posthog), 구글 애널리틱스(GA), 믹스패널(Mixpanel)과 같은 기존 분석 도구의 장점을 결합한 형태로 볼 수 있습니다.
이러한 접근 방식은 LLM 기반 서비스의 운영 효율성을 극대화하는 데 중요한 의미를 가집니다. 기업은 ABTO를 통해 비용 대비 가장 높은 유저 전환율이나 매출을 창출하는 LLM을 찾아내고, 이를 기반으로 트래픽 비율을 조정하여 서비스의 수익성을 개선할 수 있습니다. 또한, 속도와 안정성을 위해 Go 기반 게이트웨이와 다단계 폴백(fallback), 페일오버(failover) 시스템을 구축하여 고객사 서비스에 미치는 영향을 최소화했습니다. LLM API를 프로덕트에 적용하고 운영하는 과정에서 모델 교체를 고민하는 개발자들에게 ABTO는 정량적 지표를 기반으로 합리적인 의사결정을 내릴 수 있는 강력한 도구가 될 것입니다.