최근 AI 에이전트(agent)의 발전과 함께 이들의 성능을 평가하는 복잡성이 커지고 있습니다. 다양한 에이전트 벤치마크(benchmark)들이 등장하고 있지만, 각각의 환경과 통합 방식이 달라 대규모 평가는 물론 일관된 비교조차 어려웠습니다. 이러한 문제를 해결하기 위해 새로운 통합 평가 인프라 '하버 어댑터(Harbor Adapters)'와 선별된 메타 데이터셋 '하버 인덱스(Harbor-Index)'가 공개되어 주목받고 있습니다.
하버 어댑터는 80개 이상의 에이전트 벤치마크를 통합하여 어떤 에이전트라도 평가할 수 있도록 지원합니다. 연구팀은 엄격한 코드 검토와 실험을 통해 어댑터의 유효성을 검증했습니다. 이를 활용해 8개 모델과 3가지 네이티브 하네스(harness)를 조합, 54개 벤치마크에서 대규모 평가를 수행했으며, 이를 통해 에이전트의 역량과 실패 유형을 심층적으로 분석할 수 있었습니다. 특히, 하버 인덱스는 기존 벤치마크 스위트에서 난이도 필터링, AI 및 사람의 감사 과정을 거쳐 선별된 82개의 고품질 작업으로 구성되어, 대규모 평가의 도전 과제를 유지하면서도 실행 비용을 절감할 수 있도록 설계되었습니다. 현재까지 평가된 어떤 모델-하네스 조합도 30% 이상의 통과율을 보이지 않았으며, 가장 강력한 GPT-5.5(Codex 포함)조차 28.0%에 그쳐 하버 인덱스의 높은 난이도를 입증했습니다.
이러한 통합 평가 인프라의 등장은 대규모 언어모델(LLM) 기반 에이전트의 개발 및 연구에 있어 중요한 전환점이 될 것으로 보입니다. 개발자들은 이제 파편화된 벤치마크 환경에 구애받지 않고, 표준화된 방식으로 에이전트의 성능을 객관적으로 측정하고 비교할 수 있게 됩니다. 이는 에이전트의 강점과 약점을 명확히 파악하고, 개선 방향을 설정하는 데 필수적인 정보를 제공하여 더욱 신뢰할 수 있고 강력한 AI 에이전트 개발을 가속화할 것입니다. 하버 어댑터와 하버 인덱스는 오픈 소스(open-source)로 공개되어, 관련 연구와 개발 커뮤니티에 큰 기여를 할 것으로 기대됩니다.