AI 에이전트의 성능을 평가할 때, 어떤 에이전트가 더 나은지 선택하는 정확도(selection accuracy)와 잘못된 선택으로 인해 발생하는 실제 손실(utility lost) 사이에 중요한 차이가 있다는 연구 결과가 발표되었습니다. 이 '희귀 실패 평가(Rare Failure Eval)' 프로젝트는 재현 가능한 파이썬(Python) 실험을 통해, 에이전트 평가자가 더 많은 잘못된 선택을 하고도 전체적인 손실은 줄일 수 있음을 보여주며, 기존 평가 방식의 한계를 지적합니다.
이 실험은 1,024개의 시뮬레이션 환경에서 4개의 합성 에이전트와 8개의 작업을 사용하여 진행되었습니다. 특히 '분산 할당(Variance allocation)'이라는 샘플링 정책은 '균일 할당(Uniform allocation)' 대비 잘못된 에이전트 선택률을 44.4%에서 52.6%로 높였음에도 불구하고, 평균 손실(mean utility lost)은 27.8% 감소시키는 결과를 보였습니다. 이는 분산 할당이 잠재적으로 큰 손실을 초래할 수 있는 '희귀 실패' 상황에 더 많은 평가 자원을 집중하여, 비록 최적의 에이전트를 덜 정확하게 골랐을지라도 치명적인 실수의 비용을 효과적으로 줄였기 때문입니다.
이 연구는 AI 에이전트, 특히 안전이 중요한 분야의 에이전트를 평가할 때 단순히 '정확하게 선택했는지' 여부뿐만 아니라 '잘못된 선택이 얼마나 큰 손실을 초래하는지'를 함께 측정해야 함을 시사합니다. 정확도는 사소한 실수와 치명적인 실수를 동일하게 취급하는 반면, '후회(regret)'는 유틸리티 격차를 포착하지만 치명적인 위험 한계를 강제하지는 않습니다. 따라서 두 가지 지표를 모두 보고하는 것이 에이전트의 실제 성능과 안전성을 더 정확하게 파악하는 데 필수적이며, 이는 AI 시스템의 신뢰성을 높이는 데 중요한 기여를 할 것으로 기대됩니다.