최첨단 AI 모델, 특히 AI 에이전트의 역량을 측정하는 벤치마크에서 '모든 모델이 풀지 못하는 태스크'가 과연 진정한 난제일까요? 최근 한 연구에 따르면, 이러한 태스크 중 상당수는 실제 모델의 능력 부족이 아닌 다른 요인들로 인해 실패하는 '가짜 난제(fake-hardness)'일 가능성이 높다고 지적합니다. 이는 현재 AI 벤치마크의 평가 방식에 대한 중요한 질문을 던집니다.
이 연구팀은 '터미널-벤치 3 / 프론티어-벤치 0.1(Terminal-Bench 3 / Frontier-Bench 0.1)'의 실제 운영 기록을 분석했습니다. 여기에는 1,081개의 풀 리퀘스트, 639개의 평가된 태스크, 28,801회의 시도, 그리고 10만 달러가 넘는 에이전트 비용이 포함되어 있습니다. 특히 모든 에이전트가 실패한 125개의 태스크에 주목하여, 태스크 아티팩트, 레퍼런스 솔루션 실행 기록, 빈 솔루션 컨트롤, 적대적 시도, 실행 궤적, 원격 측정 데이터, 검토 기록 등을 종합적으로 검토했습니다. 그 결과, 125개 중 78개만이 '인증된 미해결(certified-unsolved)' 후보로 남았습니다.
나머지 태스크들은 '가짜 난제'로 판명되었습니다. 구체적으로는 14개 태스크에서 검증 오라클(oracle)이 고장 났고, 8개는 인프라 문제로 인해 실패했으며, 4개는 검증기 우회(verifier bypass)를 통해서만 통과 가능했습니다. 또한 21개 태스크는 가용 증거만으로는 해결 가능성을 인증할 수 없었습니다. 이는 단순히 통과율이 낮다고 해서 해당 태스크가 본질적으로 어렵다고 볼 수 없음을 명확히 보여줍니다. 연구팀은 벤치마크가 '모든 모델이 실패한 태스크'를 역량 주장으로 활용하기 전에 그 증거를 명확히 보고해야 한다고 강조합니다. 이 결과는 AI 에이전트의 진정한 한계를 파악하고, 보다 신뢰할 수 있는 벤치마크를 설계하는 데 중요한 기초 자료가 될 것입니다.
