AI 에이전트의 신뢰성을 높이는 새로운 아키텍처 'DeReAct'가 등장했습니다. 기존 ReAct 기반 에이전트는 하나의 대규모 언어모델(LLM)이 행동 제안, 환경 상호작용, 작업 완료 판단까지 모두 수행하여, 오류가 발생하면 쉽게 전파되고 불완전한 상태에서 작업이 종료되는 문제가 있었습니다. DeReAct는 이러한 결합된 구조를 분해하여, 에이전트의 안정성과 제어 가능성을 크게 향상시켰습니다.
DeReAct는 두 가지 핵심 외부 정책을 도입합니다. 첫째, '비평가(Critic)'는 에이전트가 제안하는 행동을 실행하기 전에 미리 검증하여 부적절한 행동을 차단합니다. 둘째, '컨텍스트 관리자(Context Manager)'는 환경으로부터 얻은 정보를 바탕으로 현재 상태를 재구성하고, 작업이 실제로 완료되었는지 여부를 독립적으로 인증합니다. 이 모듈화된 접근 방식 덕분에, GAIA 및 SWE-bench Verified와 같은 벤치마크에서 특히 성능이 낮은 LLM(예: Qwen3-Coder-480B, Claude Sonnet 4.5)을 사용하는 에이전트의 성공률(Pass@1)을 4.2~7.0% 포인트 개선하는 효과를 보였습니다. 반면, Claude Opus 4.5와 같이 이미 강력한 LLM의 경우 성공률 자체는 ReAct와 유사했지만, 더 많은 증거를 기반으로 제약 조건을 만족하는 완전한 작업 궤적을 생성하는 데 기여했습니다.
이는 AI 에이전트가 복잡한 작업을 수행할 때 발생할 수 있는 '환각(hallucination)'이나 불완전한 종료 문제를 줄여, 전반적인 신뢰도를 높이는 중요한 진전입니다. DeReAct는 에이전트의 '두뇌' 역할을 하는 LLM의 성능이 약할수록 더 큰 효과를 발휘하며, 강력한 LLM에게는 더 견고하고 증거 기반의 작업 완료를 가능하게 합니다. 궁극적으로 이 아키텍처는 AI 에이전트가 실제 환경에서 더 안전하고 예측 가능하게 작동하도록 돕는 기반 기술이 될 것으로 기대됩니다.