대규모 언어모델(LLM)이 복잡한 작업을 수행하기 위해 다양한 외부 도구(tool)를 활용하는 방식이 발전하고 있지만, 어떤 도구를 언제 사용할지 결정하는 과정은 여전히 큰 과제입니다. 특히 여러 단계를 거쳐야 하는 장기적인 작업(long-horizon task)에서는 각 도구 호출이 전체 작업의 흐름을 바꾸기 때문에, 중간 단계의 결정이 최종 성공에 미치는 영향을 정확히 평가하기 어렵습니다. 기존 방식은 주로 최종 결과에 대한 보상(reward)에 의존했으나, 이는 각 단계의 기여도를 명확히 파악하기 어렵다는 한계가 있었습니다.
이러한 문제를 해결하기 위해, 새로운 연구에서는 '행동하기 전에 선택하라(Choosing Before Acting)'는 원칙을 제시하며 '비교 추론 기반 도구 사용 에이전트(Comparative Inference for Tool-use Agents, CITA)'라는 방법론을 제안했습니다. CITA는 '비교 추론 모델(Comparative Inference Model, CIM)'을 훈련시켜, 다음으로 가능한 도구 호출들이 현재 상황에서 최종 작업 성공에 얼마나 기여할지 미리 예측하도록 합니다. 이 CIM은 관찰된 도구 행동, 베이지안 도구 그래프 시뮬레이터(Bayesian tool-graph simulator)의 확장 가능한 감독(supervision), 그리고 LLM 기반의 의미론적 비교 판단을 결합한 신호들을 통해 학습됩니다.
CITA는 세 가지 도구 사용 벤치마크와 여러 LLM 백본(backbone)에서 일관되게 도구 F1 점수와 작업 성공률을 향상시키는 것으로 나타났습니다. 이는 CIM이 각 단계에서 도구 선택의 비교 가치를 정확하게 추정하는 능력을 학습했음을 보여줍니다. 이 연구는 LLM 에이전트가 단순히 도구를 사용하는 것을 넘어, 더 전략적이고 효율적으로 도구를 활용하여 복잡한 문제를 해결할 수 있는 중요한 발판을 마련했습니다. 앞으로 LLM 기반 에이전트의 실제 적용 가능성과 성능을 크게 높이는 데 기여할 것으로 기대됩니다.