최근 arXiv에 공개된 AREX-2 연구는 대규모 언어모델(LLM) 기반 에이전트가 스스로 문제 해결 능력을 개선하는 새로운 길을 제시합니다. 이 연구는 에이전트가 테스트 시점에 해법을 반복적으로 정제할 수 있는 '자가 개선(self-improving)' 능력에 초점을 맞추고 있습니다. 이는 기존 AI 에이전트의 한계를 뛰어넘어, 더욱 복잡하고 지속적인 문제 해결이 가능해졌다는 점에서 주목할 만합니다.
AREX-2의 핵심은 '반성(reflection)'과 '장기 실행(long-horizon execution)'이라는 두 가지 상호 보완적인 능력에 있습니다. 반성은 현재 해법보다 더 나은 해법을 생성하는 능력이며, 장기 실행은 여러 라운드에 걸쳐 반복 작업을 효과적으로 유지하는 능력입니다. 연구팀은 이 두 능력이 특정 도메인에 국한되지 않고 보편적으로 학습될 수 있다고 가설을 세웠습니다. 이에 따라, 검증 가능한 피드백과 지속적인 반복에 대한 보상이 명확한 머신러닝(ML) 및 알고리즘 프로그래밍 과제에서 장기적인 개선 궤적 데이터를 합성하여 에이전트를 훈련했습니다. Qwen3.8-27B 모델을 기반으로 구축된 AREX-2는 MLE-bench Lite에서 81.8점, Frontier-CS에서 70.7점이라는 높은 점수를 기록했으며, BrowseComp에서 84.0점, HLE에서 52.6점, GAIA에서 92.2점, DeepSearchQA에서 93.8점 등 심층 연구 분야에서도 뛰어난 전이 학습(transfer learning) 성능을 보였습니다.
이러한 결과는 장기적인 반성적(reflective) 데이터가 자가 개선 에이전트 개발에 효과적인 방법임을 입증합니다. 에이전트가 예산(라운드 수)이 늘어날수록 지속적으로 개선되는 모습을 보여, 복잡한 실제 문제 해결에 AI를 적용할 가능성을 더욱 넓혔습니다. 이는 단순히 주어진 문제를 푸는 것을 넘어, 스스로 학습하고 발전하는 AI의 미래를 앞당기는 중요한 진전으로 평가됩니다. 앞으로 AI 에이전트가 더욱 자율적으로 복잡한 과제를 수행하고, 인간의 개입 없이도 지속적으로 성능을 향상시키는 데 기여할 것으로 기대됩니다.