인공지능(AI) 에이전트가 외부 도구(tool)를 활용해 작업을 수행할 때, 때로는 도구에서 발생한 오류를 에이전트가 인지하지 못하고 잘못된 결과를 사실로 받아들이는 문제가 발생합니다. 예를 들어, 캐시된 오류 페이지나 잘못된 가격 정보가 정상적인 응답처럼 전달되어 에이전트가 이를 바탕으로 잘못된 결정을 내릴 수 있는데, 이를 '침묵하는 오류(silent tool failures)'라고 부릅니다. 이러한 오류는 에이전트의 신뢰성과 작업 성공률을 저해하는 주요 원인 중 하나입니다.
최근 발표된 연구 논문은 이러한 침묵하는 오류를 해결하기 위한 '아웃컴 모니터(Outcome Monitors)'라는 새로운 개념을 제시했습니다. 아웃컴 모니터는 도구 호출의 '결과 계약(outcome contracts)' 위반 여부를 감지하는 시스템입니다. 이 계약은 과거의 작업 추적 데이터나 공개된 스키마(public schemas)를 분석하여 도출되며, 도구 응답이 특정 조건을 충족하는지 검증합니다. 만약 위반 사항이 감지되면, 모니터는 해당 결과를 보존하고 어떤 속성이 위반되었는지, 그리고 어떤 복구 도구(recovery tools)를 사용할 수 있는지에 대한 비구속적인 영수증(nonbinding receipt)을 발행합니다.
연구팀은 주입된 오류를 포함한 평가 환경에서 아웃컴 모니터의 효과를 검증했습니다. 그 결과, 아웃컴 모니터를 적용했을 때 'ToolMaze'라는 테스트에서 네 가지 모델의 작업 완료율이 10.9%에서 28.1%로 크게 향상되었습니다. 이는 복구 도구 목록이 제공될 때 이러한 개선 효과가 나타났으며, 진단 세부 정보나 타이밍은 큰 영향을 미치지 않았습니다. 이 기술은 AI 에이전트가 외부 도구와 상호작용하는 방식의 신뢰성을 높이고, 궁극적으로 더 복잡하고 중요한 작업을 성공적으로 수행할 수 있도록 돕는 중요한 진전으로 평가됩니다. 특히, 오류가 작업 완료를 직접적으로 방해하는 상황에서 그 효과가 집중적으로 나타났습니다.
