최근 arXiv에 발표된 연구 논문 '하위 작업 분해 강화 학습(Reinforcement Learning with Decomposed Subtasks, RLDS)'은 대규모 언어모델(LLM) 기반 AI 에이전트의 학습 방식을 혁신할 잠재력을 보여줍니다. 기존의 정책 경사(policy-gradient) 방식은 에이전트가 여러 단계에 걸쳐 수행한 작업을 하나의 스칼라 보상(scalar reward)으로 통합하여 평가했습니다. 그러나 이 방식은 복잡한 작업에서 에이전트가 어떤 행동이 성공에 기여했는지 정확히 파악하기 어렵게 만들어 학습 효율을 저해하는 문제가 있었습니다.
연구진은 이러한 문제를 해결하기 위해 '하위 작업 분해 이점 추정(Subtask-Decomposed Advantage Estimation, SDAE)'이라는 핵심 개념을 도입했습니다. SDAE는 전체 작업 보상을 미리 정의된 하위 작업(subtask)별로 분할하고, 각 하위 작업에 대해 개별적인 이점(advantage)을 계산합니다. 이후 각 하위 작업의 중요도를 고려하여 토큰(token)별 기여도를 배분함으로써, 에이전트가 특정 하위 작업의 수행이 결과에 미친 영향을 명확히 인지하고 학습할 수 있도록 돕습니다. 이 방법은 특히 희소하고 지연된 환경 피드백(sparse and delayed environmental feedback)이 주어지는 상황에서 강력한 이점을 가집니다.
RLDS는 FrozenLake(희소한 그리드 탐색), HotpotQA(다중 홉 질의응답), ScienceWorld(장기적인 과학 탐구), DeepResearch(장문 연구) 등 네 가지 에이전트 벤치마크에서 평가되었습니다. 그 결과, 하위 작업의 이질성(heterogeneity)이 높은 ScienceWorld와 FrozenLake에서 각각 11.5점, 9.8점의 성능 향상을 보이며 RLDS의 효과가 입증되었습니다. 또한, ScienceWorld에서는 기존 방식 대비 단계별 연산 시간(wall-clock per step)을 10.9% 절감하는 등 연산 효율성도 개선되었습니다. 이는 복잡한 작업을 수행하는 AI 에이전트의 학습 과정에서 보상 설계의 중요성과 함께, 작업 분해를 통한 미세한 피드백이 성능 향상에 결정적인 역할을 한다는 것을 시사합니다.
