yozm.tech
피드로 돌아가기
arXiv (cs.AI)HOTAI 재작성

AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

최근 공개된 AREX-2는 대규모 언어모델(LLM) 에이전트의 자가 개선(self-improving) 능력을 획기적으로 향상시켰습니다. 이 에이전트는 '반성(reflection)'과 '장기 실행(long-horizon execution)'이라는 두 가지 핵심 역량을 통해 테스트 시점에 스스로 해법을 반복적으로 개선합니다. 이는 머신러닝 및 알고리즘 프로그래밍 과제에서 얻은 데이터를 학습하여 다양한 연구 분야에서 뛰어난 성능을 보였습니다.

7시간 전·2026.10.01·읽기 1분·Hongjin Qian, Chaofan Li, Kun Luo, Wenqing Wei, Jianlyu Chen, Shuqi Lu, Yuyang Hu, Hongwang Xiao, Hui Wang, Chaozhuo Li, Qiwei Ye, Zhicheng Dou, Defu Lian, Zheng Liu

최근 arXiv에 공개된 AREX-2 연구는 대규모 언어모델(LLM) 기반 에이전트가 스스로 문제 해결 능력을 개선하는 새로운 길을 제시합니다. 이 연구는 에이전트가 테스트 시점에 해법을 반복적으로 정제할 수 있는 '자가 개선(self-improving)' 능력에 초점을 맞추고 있습니다. 이는 기존 AI 에이전트의 한계를 뛰어넘어, 더욱 복잡하고 지속적인 문제 해결이 가능해졌다는 점에서 주목할 만합니다.

AREX-2의 핵심은 '반성(reflection)'과 '장기 실행(long-horizon execution)'이라는 두 가지 상호 보완적인 능력에 있습니다. 반성은 현재 해법보다 더 나은 해법을 생성하는 능력이며, 장기 실행은 여러 라운드에 걸쳐 반복 작업을 효과적으로 유지하는 능력입니다. 연구팀은 이 두 능력이 특정 도메인에 국한되지 않고 보편적으로 학습될 수 있다고 가설을 세웠습니다. 이에 따라, 검증 가능한 피드백과 지속적인 반복에 대한 보상이 명확한 머신러닝(ML) 및 알고리즘 프로그래밍 과제에서 장기적인 개선 궤적 데이터를 합성하여 에이전트를 훈련했습니다. Qwen3.8-27B 모델을 기반으로 구축된 AREX-2는 MLE-bench Lite에서 81.8점, Frontier-CS에서 70.7점이라는 높은 점수를 기록했으며, BrowseComp에서 84.0점, HLE에서 52.6점, GAIA에서 92.2점, DeepSearchQA에서 93.8점 등 심층 연구 분야에서도 뛰어난 전이 학습(transfer learning) 성능을 보였습니다.

이러한 결과는 장기적인 반성적(reflective) 데이터가 자가 개선 에이전트 개발에 효과적인 방법임을 입증합니다. 에이전트가 예산(라운드 수)이 늘어날수록 지속적으로 개선되는 모습을 보여, 복잡한 실제 문제 해결에 AI를 적용할 가능성을 더욱 넓혔습니다. 이는 단순히 주어진 문제를 푸는 것을 넘어, 스스로 학습하고 발전하는 AI의 미래를 앞당기는 중요한 진전으로 평가됩니다. 앞으로 AI 에이전트가 더욱 자율적으로 복잡한 과제를 수행하고, 인간의 개입 없이도 지속적으로 성능을 향상시키는 데 기여할 것으로 기대됩니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
3/10
약한 신호
왜 3점인가

원천 기술 개발은 어렵지만, 특정 도메인에 특화된 응용 서비스 기회는 존재합니다.

문제 / 미충족 수요

AI 에이전트가 복잡한 문제를 해결하는 과정에서 스스로의 성능을 지속적으로 개선하고 최적화하는 데 어려움이 있습니다.

한국 시장
국내 있음한국에서도 LLM 에이전트 연구 및 개발이 활발하지만, '자가 개선'에 초점을 맞춘 상용화된 서비스는 아직 초기 단계입니다.
수익 모델

B2B SaaS 구독, API 종량제 · 돈 내는 주체: 복잡한 문제 해결 및 최적화가 필요한 기업 고객 (예: R&D 부서, 컨설팅 회사)

1인 실현 가능성
2/5

핵심 기술은 대규모 언어모델(LLM) 기반이며, 데이터셋 구축 및 모델 훈련에 상당한 자원과 전문성이 필요하여 1인 창업자가 원천 기술을 개발하기는 어렵습니다.

진입 지점 (Wedge)

특정 산업 도메인(예: 법률, 의료)에 특화된 자가 개선 에이전트 개발을 위한 미세조정(fine-tuning) 데이터셋 및 프롬프트 엔지니어링 서비스 제공

이번 주 첫 실험

특정 산업 분야의 전문가 5~10명을 대상으로 AI 에이전트의 자가 개선 필요성에 대한 인터뷰를 진행하고, 어떤 종류의 '반성적 데이터'가 가치 있을지 파악한다.

Original source
이 글은 arXiv (cs.AI)의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기