AI 모델 서비스 기업 파이어웍스(Fireworks)가 'Ember-1'이라는 새로운 전문 모델을 발표했습니다. 이 모델은 기존 Kimi K3 모델과 동일한 수준의 품질을 제공하면서도 토큰(token) 사용량을 최대 40%까지 줄여 비용 효율성을 극대화한 것이 특징입니다. 특히 다중 턴(multi-turn) 에이전트 워크로드에서 발생하는 불필요한 추론(reasoning) 과정을 제거하여, 대규모 AI 애플리케이션 운영 비용을 크게 절감할 수 있을 것으로 예상됩니다.
파이어웍스 연구팀은 Kimi K3 모델이 답변 생성 과정에서 90% 이상의 토큰을 내부 추론에 사용하며, 이 중 상당 부분이 불필요하다는 점에 주목했습니다. 특히 에이전트 기반 작업에서는 이전 추론이 매 턴마다 반복되어 컨텍스트(context) 길이가 기하급수적으로 늘어나고 비용이 증가하는 문제가 있었습니다. Ember-1은 이러한 비효율적인 추론을 제거하고 핵심적인 사고 과정만을 유지하도록 50회 이상의 훈련 실험과 200회 이상의 평가를 거쳐 개발되었습니다. 파이어웍스의 서버리스 훈련(Serverless Training) 플랫폼을 활용하여 신속하고 비용 효율적으로 모델을 개발할 수 있었다고 밝혔습니다.
Ember-1은 수학, 코딩, 지시 따르기, 대화, 검색, 도구 사용 등 광범위한 작업에 걸쳐 훈련되었으며, 실시간 고객 A/B 테스트와 내부 개발자 검증을 통해 품질 저하 없이 토큰 절감 효과를 입증했습니다. 파이어웍스는 Ember-1이 의료 분야 벤치마크인 'Bedside Bench'에서 GPT-5.6 Sol, GPT-6 Astra, Claude Opus 5 등 주요 모델들을 제치고 비용 대비 성능(Pareto frontier)에서 새로운 기준을 세웠다고 강조했습니다. 이는 AI 모델의 성능과 비용 효율성 사이의 균형점을 찾는 데 있어 중요한 진전을 의미하며, 앞으로도 Ember 시리즈를 통해 개발자들이 원하는 전문화된 모델을 지속적으로 선보일 예정입니다.
