최근 공개된 AI 의사결정 모델 '지브스(Jeeves)'가 복잡한 질문에 대한 정확도를 획기적으로 개선하며 주목받고 있습니다. 기존 '제브(Jev)' 방식이 선택지별 확률을 즉시 제시하는 반면, 지브스는 답변을 내놓기 전에 추론 과정을 거치도록 학습되어 더 정교한 판단이 가능합니다. 이는 고객 문의 분류, 긴급 대응 필요성 판단, 고객 불만 정도 평가 등 다양한 실제 적용 사례에서 높은 효용성을 보일 것으로 기대됩니다.
지브스는 Qwen3.5-9B 모델을 기반으로 하며, '케브(Kev)'에서 영감을 받아 제브 방식의 아키텍처를 따릅니다. 특히, 자체 평가 벤치마크인 JevBench의 공개 231문항에서 93.5%의 정확도를 기록하며 제브의 86.6%를 크게 앞섰습니다. 어려운 111문항에서는 86.5% 대 73.0%로 격차를 더욱 벌렸습니다. 지브스는 확신이 높은 질문에는 추론을 생략하고, 어려운 질문에는 더 많은 추론을 수행하도록 조절할 수 있어 속도와 정확도 사이의 균형을 맞출 수 있습니다. 추론 생성을 가속하기 위해 확산 기반 초안 모델(diffusion drafter)을 활용하며, 9B 가중치와 전체 학습 코드, 학습 및 평가 데이터를 모두 공개하여 개발자들이 직접 실행하고 재학습할 수 있도록 했습니다.
이러한 '판단 전 추론' 방식은 기존 대규모 언어모델(LLM)이 복잡한 추론을 위해 별도의 프롬프트 엔지니어링이나 다단계 처리 과정을 거쳐야 했던 한계를 극복합니다. 지브스는 모델 자체에 추론 능력을 내재화하여 하나의 요청으로 여러 질문에 대한 확률과 점수를 동시에 얻을 수 있습니다. 예를 들어, 고객 문의 내용 하나로 담당 부서, 긴급 대응 필요성, 불만 정도를 한 번에 파악하는 것이 가능해집니다. 이는 기업의 고객 지원 시스템이나 콘텐츠 검수 등 빠른 의사결정이 필요한 분야에서 효율성을 크게 높일 수 있습니다. 다만, 추론 과정이 길어질 경우 응답 지연 시간이 늘어날 수 있으므로, 사용 목적에 따라 추론 길이와 생략 기준을 적절히 조절하는 것이 중요합니다.