인공지능(AI) 모델을 실제 서비스에 적용할 때, 공개 벤치마크(public benchmark)에서 높은 점수를 받은 모델이 항상 최고의 선택은 아니라는 주장이 나왔습니다. deepsense.ai는 블로그를 통해 AI 시스템 평가에 있어 벤치마크의 한계를 지적하고, 실제 운영 환경에 적합한 평가 방식의 중요성을 강조했습니다. 이는 단순히 모델의 성능을 넘어, 전체 시스템의 안정성과 비즈니스 가치를 고려해야 한다는 의미입니다.
deepsense.ai는 2026년 현재 AI 평가 벤치마크들이 SWE-Lancer, GDPval, τ-bench 등 실제 작업 흐름을 반영하는 방향으로 발전하고 있음을 인정했습니다. 하지만 이러한 벤치마크들도 여전히 반복적인 작업 흐름이나 복잡한 도구 사용 시나리오를 완전히 포착하지 못하며, 특정 벤치마크에 최적화된 모델이 실제 환경에서 동일한 성능을 보장하지 못하는 한계가 있다고 설명했습니다. 벤치마크가 '타겟'이 되어 모델이 특정 평가 프로토콜에만 잘 작동하도록 튜닝될 수 있다는 점도 문제로 지적됩니다. 예를 들어, OpenAI는 SWE-Bench Pro 작업의 약 30%가 과도하게 엄격한 테스트나 불분명한 프롬프트로 인해 제대로 작동하지 않는다고 추정하기도 했습니다.
따라서 공개 벤치마크는 AI 모델의 초기 후보군을 선정하고 대략적인 성능을 비교하는 데는 유용하지만, 실제 배포 결정을 내릴 때는 충분하지 않다는 것이 핵심입니다. 기업은 모델 자체뿐만 아니라 시스템 프롬프트, 도구 정의, 컨텍스트 관리, 메모리, 권한, 재시도 로직, 유효성 검사, 비용, 속도, 위험 수준 등 전체 AI 시스템이 실제 운영 조건에서 반복적으로 유용한 비즈니스 성과를 제공할 수 있는지를 평가해야 합니다. 이는 AI 시스템의 성공적인 상용화를 위해 필수적인 고려 사항이며, 벤치마크 점수만으로는 알 수 없는 복합적인 요소들을 종합적으로 판단해야 함을 시사합니다.
