ARC-AGI-3(Abstraction and Reasoning Corpus - Artificial General Intelligence 3) 리더보드가 공개되며 인공지능(AI)의 진정한 지능을 측정하는 새로운 기준을 제시했습니다. 기존 ARC-AGI-1 및 ARC-AGI-2가 수동적인 유동 지능(passive fluid intelligence)을 측정했던 것과 달리, ARC-AGI-3는 AI 에이전트가 새로운 상호작용 환경에 즉석에서 적응하는 능력을 핵심적으로 평가합니다. 이는 단순히 문제를 해결하는 것을 넘어, 최소한의 자원으로 효율적으로 문제를 해결하는 능력을 진정한 지능의 척도로 보고 있습니다.
이번 리더보드는 비용 대비 성능(cost-per-task vs. performance)이라는 중요한 효율성 지표를 시각화하여 보여줍니다. 평가 시스템은 크게 세 가지 유형으로 나뉩니다. 첫째, 추론 시스템(Reasoning Systems)은 동일 모델의 다양한 추론 레벨을 연결된 점으로 표시하여, 추론 시간 증가가 성능에 미치는 영향을 보여줍니다. 둘째, 기본 대규모 언어모델(Base LLMs)은 GPT-4.5, Claude 3.7과 같은 표준 언어 모델의 단일 추론(single-shot inference) 성능을 추가 추론 기능 없이 보여줍니다. 셋째, 캐글 시스템(Kaggle Systems)은 캐글(Kaggle) 챌린지에서 제출된 경쟁 등급 솔루션으로, 120개 평가 작업에 50달러의 컴퓨팅 예산이라는 엄격한 제약 조건 하에 설계된 효율적인 방법론을 선보입니다.
ARC-AGI-3 리더보드는 AI 연구의 방향성을 '문제 해결'에서 '효율적이고 적응적인 문제 해결'로 전환하고 있음을 시사합니다. 특히 비용 효율성을 중요한 평가 지표로 삼는 것은 AI 모델의 상업적 활용 가능성과 직결됩니다. 제한된 자원으로 높은 성능을 내는 AI 모델은 실제 비즈니스 환경에서 더 큰 가치를 창출할 수 있기 때문입니다. 이는 미래 AI 개발이 단순히 성능 향상뿐만 아니라 자원 최적화와 실시간 적응력에 집중해야 함을 보여주는 중요한 이정표가 될 것입니다.