오픈AI의 최신 대규모 언어모델(LLM) GPT-6 아스트라(Astra)가 새로운 에이전트 지능 벤치마크인 ARC-AGI-3에서 인간의 효율성을 뛰어넘는 놀라운 성과를 기록했습니다. 아스트라는 낯선 환경을 스스로 탐색하고, 목표를 추론하며, 내부 모델을 구축해 효과적으로 행동을 계획하는 '에이전트 지능' 능력을 시험하는 이 벤치마크에서 최첨단 점수를 달성했습니다. 이는 인공일반지능(AGI) 개발에 있어 중요한 이정표로 평가받고 있습니다.
아스트라는 ARC-AGI-3 벤치마크에서 '표준 하네스(Standard harness)' 사용 시 62.7%의 점수를 기록했으며, '프로바이더 어댑터 하네스(Provider Adapter harness)'를 활용했을 때는 99.9%라는 경이로운 점수를 달성했습니다. 특히 주목할 점은 아스트라가 인간보다 훨씬 적은 행동으로 문제를 해결하며 '행동 효율성' 측면에서 인간의 중앙값을 96%의 레벨에서 능가했다는 것입니다. 아스트라는 게임 메커니즘을 논리적 규칙으로 표현하고, 자체적인 도메인 특화 언어(DSL)를 개발하여 상태를 추적하고 행동을 계획하는 등, 복잡한 환경을 간결한 기호적 세계 모델로 전환하는 능력을 보여주었습니다.
이러한 아스트라의 성과는 단순히 높은 점수를 넘어섭니다. 낯선 환경에서 스스로 학습하고 추론하며 효율적으로 문제를 해결하는 능력은 현재 인공지능(AI)이 직면한 '잔여 격차(residual gap)'를 줄이는 데 핵심적인 요소입니다. 아스트라가 보여준 고유한 대수적 표기법 개발, 인간보다 뛰어난 행동 효율성, 그리고 맞춤형 도구 구축 능력은 미래 AI가 다양한 실제 문제에 적용될 수 있는 잠재력을 시사합니다. 이는 AI가 단순한 패턴 인식 도구를 넘어, 자율적으로 복잡한 상황을 이해하고 해결하는 진정한 에이전트(agent)로 발전하고 있음을 보여주는 중요한 증거입니다.