최근 Fireworks.ai가 공개한 Kimi K3 모델이 대규모 언어모델(LLM) 시장에 새로운 바람을 불어넣고 있습니다. Kimi K3는 폐쇄형 고성능 모델인 Fable 5와 비교했을 때 거의 동등한 수준의 성능을 보이면서도, 특정 작업에서는 최대 50배까지 비용 효율적이라는 점이 밝혀졌습니다. 이는 단순히 저렴한 모델이 아니라, 전략적인 모델 라우팅을 통해 최고 품질의 인공지능(AI) 결과물을 얻을 수 있는 가능성을 열어줍니다.
Fireworks.ai는 약 1,000개의 에이전트 작업(agentic tasks)을 대상으로 Kimi K3와 Fable 5를 비교 평가했습니다. 소프트웨어 엔지니어링(SWE), 터미널 작업, 알고리즘, 다국어 구현, 법률 등 다양한 분야의 벤치마크에서 두 모델은 전반적으로 유사한 정확도를 보였습니다. 예를 들어, SWE 벤치마크에서 K3는 92.4%, Fable은 92.6%를 기록하며 거의 차이가 없었습니다. 하지만 세부적으로 살펴보면, K3는 기호 수학과 개발 도구에서 강점을 보였고, Fable은 웹 및 데이터 시각화 작업에서 우위를 나타내는 등 각 모델이 특화된 영역이 명확했습니다. 특히, K3는 장기적인 터미널 작업에서 Fable이 해결하지 못한 복잡한 보안 및 암호화 관련 문제들을 해결하며 뛰어난 성능을 입증했습니다.
가장 주목할 점은 두 모델을 적절히 라우팅(routing)했을 때의 시너지 효과입니다. 연구 결과, 작업 유형에 따라 K3와 Fable을 선택적으로 활용하는 오라클 라우팅(oracle routing) 방식을 적용했을 때 93%의 정확도를 달성했으며, 이는 단일 모델 사용 대비 월등히 높은 수치입니다. 또한, 이러한 라우팅 전략은 장기 에이전트 루프(long agentic loops)에서 Fable 단독 사용 대비 최대 50배까지 비용을 절감할 수 있음을 보여주었습니다. 이는 AI 애플리케이션 개발자들이 더 이상 단일 최고 성능 모델을 고집할 필요 없이, 여러 모델의 장점을 조합하여 성능과 비용 효율성을 동시에 극대화할 수 있는 새로운 패러다임을 제시합니다. 앞으로는 어떤 모델을 선택하느냐보다, 어떤 모델에 어떤 작업을 할당할 것인지 결정하는 라우팅 전략이 AI 활용의 핵심이 될 것입니다.