대규모 언어모델(LLM) 기반의 역할 연기(role-playing) 에이전트는 개인 비서나 사회 시뮬레이션 등 다양한 분야에서 활용되고 있습니다. 하지만 기존 강화 학습(RL) 방식은 미리 수집된 고정된 시나리오 풀에 의존하여 훈련하는 한계가 있었습니다. 에이전트의 성능이 향상될수록 에이전트가 어려워하는 시나리오도 변하는데, 훈련 데이터는 정체되어 있어 학습 효율이 떨어지는 문제가 발생했습니다.
이러한 문제를 해결하기 위해 'AdvRole'이라는 적대적 맥락 재작성(adversarial context rewriting) 프레임워크가 제안되었습니다. AdvRole은 역할 연기 강화 학습을 폐쇄 루프 커리큘럼(closed-loop curriculum)으로 전환합니다. 이 프레임워크는 역할 연기를 학습하는 '액터(Actor)'와 캐릭터 프로필 및 대화 맥락을 액터에게 어려운 시나리오로 편집하는 '리라이터(Rewriter)'가 번갈아 가며 작동합니다. 리라이터는 현재 액터의 점수를 원래 시나리오 대비 낮추는 방향으로 시나리오를 재작성하도록 훈련되며, 이를 통해 시나리오 풀은 액터와 함께 진화하며 에이전트가 미숙한 영역을 지속적으로 공략하게 됩니다.
AdvRole은 영어와 중국어를 포함하는 세 가지 기존 역할 연기 벤치마크와 새롭게 공개된 다국어 벤치마크에서 기존 기준선(baselines)보다 일관되게 우수한 성능을 보였습니다. 이는 에이전트가 스스로 약점을 파악하고 이를 보완하는 방향으로 훈련 환경을 능동적으로 변화시키는 것이 얼마나 중요한지를 보여줍니다. 이 접근 방식은 LLM 기반 에이전트의 학습 효율을 높이고, 더욱 견고하며 실제 환경에 가까운 역할을 수행할 수 있도록 발전시키는 데 기여할 것으로 기대됩니다.
