yozm.tech
피드로 돌아가기
arXiv (cs.AI)HOTAI 재작성

DeReAct: Decomposed Reasoning and Acting for Reliable AI Agents

AI 에이전트의 신뢰성과 안정성을 높이는 새로운 아키텍처 'DeReAct'가 공개되었습니다. 기존 ReAct 방식의 단일 대규모 언어모델(LLM) 정책이 가진 오류 전파 문제를 해결하기 위해, 행동 검증을 담당하는 '비평가(Critic)'와 작업 완료를 확인하는 '컨텍스트 관리자(Context Manager)'라는 두 가지 외부 정책을 도입했습니다. 이를 통해 특히 성능이 낮은 LLM 기반 에이전트의 작업 성공률을 크게 향상시키는 효과를 보였습니다.

6시간 전·2026.10.05·읽기 1분·Ajay Vohra, Tao Chen, Neeti Narayan, Caron Zhang

AI 에이전트의 신뢰성을 높이는 새로운 아키텍처 'DeReAct'가 등장했습니다. 기존 ReAct 기반 에이전트는 하나의 대규모 언어모델(LLM)이 행동 제안, 환경 상호작용, 작업 완료 판단까지 모두 수행하여, 오류가 발생하면 쉽게 전파되고 불완전한 상태에서 작업이 종료되는 문제가 있었습니다. DeReAct는 이러한 결합된 구조를 분해하여, 에이전트의 안정성과 제어 가능성을 크게 향상시켰습니다.

DeReAct는 두 가지 핵심 외부 정책을 도입합니다. 첫째, '비평가(Critic)'는 에이전트가 제안하는 행동을 실행하기 전에 미리 검증하여 부적절한 행동을 차단합니다. 둘째, '컨텍스트 관리자(Context Manager)'는 환경으로부터 얻은 정보를 바탕으로 현재 상태를 재구성하고, 작업이 실제로 완료되었는지 여부를 독립적으로 인증합니다. 이 모듈화된 접근 방식 덕분에, GAIA 및 SWE-bench Verified와 같은 벤치마크에서 특히 성능이 낮은 LLM(예: Qwen3-Coder-480B, Claude Sonnet 4.5)을 사용하는 에이전트의 성공률(Pass@1)을 4.2~7.0% 포인트 개선하는 효과를 보였습니다. 반면, Claude Opus 4.5와 같이 이미 강력한 LLM의 경우 성공률 자체는 ReAct와 유사했지만, 더 많은 증거를 기반으로 제약 조건을 만족하는 완전한 작업 궤적을 생성하는 데 기여했습니다.

이는 AI 에이전트가 복잡한 작업을 수행할 때 발생할 수 있는 '환각(hallucination)'이나 불완전한 종료 문제를 줄여, 전반적인 신뢰도를 높이는 중요한 진전입니다. DeReAct는 에이전트의 '두뇌' 역할을 하는 LLM의 성능이 약할수록 더 큰 효과를 발휘하며, 강력한 LLM에게는 더 견고하고 증거 기반의 작업 완료를 가능하게 합니다. 궁극적으로 이 아키텍처는 AI 에이전트가 실제 환경에서 더 안전하고 예측 가능하게 작동하도록 돕는 기반 기술이 될 것으로 기대됩니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
4/10
보통
왜 4점인가

기존 AI 에이전트의 명확한 문제점을 해결하지만, 1인 창업자가 범용적인 솔루션을 만들기에는 기술적 난이도와 검증 비용이 높습니다. 특정 니치 시장에 집중할 경우 기회가 있을 수 있습니다.

문제 / 미충족 수요

기존 ReAct 기반 AI 에이전트는 단일 LLM 정책으로 인해 오류가 전파되고 불완전한 작업 종료가 발생할 수 있어 신뢰성이 부족합니다.

한국 시장
국내 불명한국에서도 LLM 기반 에이전트 개발이 활발하지만, 신뢰성 및 안정성 검증에 대한 솔루션은 아직 초기 단계입니다.
수익 모델

B2B SaaS 구독, API 종량제 · 돈 내는 주체: AI 에이전트를 개발하거나 운영하는 기업, 특히 신뢰성과 정확성이 중요한 산업 분야의 기업

1인 실현 가능성
3/5

핵심 아이디어 구현은 가능하나, 다양한 LLM 및 환경에 대한 범용적인 적용은 복잡하며, LLM 최적화 및 평가에 전문성이 필요합니다.

진입 지점 (Wedge)

특정 산업 도메인(예: 법률, 의료)에서 복잡한 문서 분석 및 요약 작업을 수행하는 AI 에이전트의 신뢰성 검증 모듈을 제공합니다.

이번 주 첫 실험

DeReAct 아키텍처의 핵심 아이디어를 활용하여 특정 도메인(예: 간단한 웹 스크래핑 자동화)에서 LLM 에이전트의 행동을 검증하고 완료를 확인하는 프로토타입을 개발합니다.

Original source
이 글은 arXiv (cs.AI)의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기