파이어웍스 리서치(Fireworks Research)가 대규모 언어모델(LLM)의 비용 효율성을 혁신적으로 개선한 새로운 모델 'Ember-1'을 공개했습니다. 이 모델은 기존 Kimi K3의 강력한 코딩 및 에이전트 작업 성능을 그대로 유지하면서도, 토큰 사용량을 최대 40%까지 절감하여 운영 비용을 크게 낮출 수 있습니다. 이는 불필요한 추론 과정을 줄이고 유용한 자기 성찰(self-reflection) 능력은 보존하도록 정교하게 학습된 결과입니다.
Ember-1은 Kimi K3의 긴 추론 과정이 대규모 자동 코딩 비용을 높이는 문제를 해결하기 위해 개발되었습니다. 기존에는 추론 강도를 낮추면 품질 손실이 너무 커서 대안이 마땅치 않았습니다. 파이어웍스 리서치는 50회 이상의 학습 실험과 200회 이상의 평가를 거쳐, 정확도를 잃지 않으면서 추론을 줄이는 새로운 학습 알고리듬을 개발했습니다. 코딩 및 에이전트 벤치마크뿐만 아니라 두 곳의 실제 고객사 프로덕션 환경 A/B 테스트에서도 작업당 토큰을 약 35% 절감하면서 품질을 유지하거나 개선하는 성과를 보였습니다. 한 고객사는 이미 Ember-1을 프로덕션에 도입했으며, 파이어웍스 내부 개발자들도 모델 교체를 알아차리지 못할 정도로 자연스럽게 전환이 이루어졌습니다.
이번 Ember-1의 출시는 LLM 활용의 핵심 과제인 비용 효율성 문제를 해결하는 중요한 진전입니다. 특히 생성 토큰의 대부분을 내부 추론에 사용하는 에이전트 작업이나 여러 턴으로 이어지는 상호작용에서 누적 입력 토큰이 기하급수적으로 증가하는 문제를 효과적으로 완화할 수 있습니다. 이는 기업들이 AI 에이전트 및 자동화된 코딩 시스템을 더 경제적으로 구축하고 확장할 수 있는 기반을 마련해 줍니다. Ember-1은 현재 파이어웍스 서버리스(Serverless) API를 통해 연구 프리뷰(Research Preview)로 제공되며, 기업 데이터로 맞춤 학습하는 기능도 지원하여 특정 도메인에 최적화된 고효율 모델 구축 가능성을 열어주고 있습니다. 이는 오픈소스 모델 생태계의 발전과 함께 독점 모델과의 경쟁을 더욱 심화시킬 것으로 예상됩니다.