수중 자율 무인 잠수정(AUV)들이 복잡한 수중 환경에서 움직이는 표적을 효과적으로 추적하는 것은 오랫동안 어려운 과제였습니다. 제한된 음향 통신, 시시각각 변하는 네트워크(ad-hoc network) 위상, 예측 불가능한 해양 교란 속에서 여러 대의 AUV가 협력하여 표적을 추적하려면 고도의 분산형 조정 능력이 필수적입니다. 최근 발표된 연구는 이러한 문제를 해결하기 위해 'VGG-MADiffRL'이라는 새로운 다중 에이전트 확산 강화 학습(Multi-Agent Diffusion Reinforcement Learning) 접근 방식을 제안했습니다.
이 연구는 기존 다중 에이전트 강화 학습(MARL) 방식이 겪던 고차원 상태-행동 모델링, 노이즈에 민감한 정책 생성, 불안정한 학습 등의 문제점을 개선하는 데 초점을 맞췄습니다. 제안된 VGG-MADiffRL은 확산 정책(diffusion policies)에 가치 기울기(value gradients)를 통합하여, 역잡음 제거(reverse denoising) 과정에서 행동 생성을 유도하고 더 높은 기대 보상(expected returns)을 향하도록 합니다. 또한, 과대평가(overestimation)와 학습 진동(training oscillations)을 완화하기 위해 트윈 가치 네트워크(twin value networks)와 소프트 타겟 업데이트(soft target updates)를 활용하여 학습 안정성을 높였습니다. 이와 함께 'MDCA'라는 확산 기반 계층적 제어 아키텍처를 통해 전역 제어, 지역 온라인 학습, 물리적 행동 실행의 3단계 폐쇄 루프 제어 프레임워크를 구축하여 시너지 효과를 극대화했습니다.
이 기술은 수중 임무의 특성을 반영하여 음파 탐지(sonar) 메커니즘과 해류 교란을 모델링하고, 다중 AUV 애드혹 네트워크의 협력 추적을 마르코프 결정 과정(MDP)으로 공식화했습니다. 실험 결과, VGG-MADiffRL은 협력 추적 시나리오에서 기존 방식보다 일관되게 더 빠른 수렴, 높은 추적 정확도, 그리고 더 부드러운 학습 동역학을 보여주었습니다. 이는 동적인 수중 환경에서 이 기술의 효과성과 실용적인 공학적 가치를 입증하는 것으로, 해양 탐사, 수중 자원 개발, 그리고 국방 분야의 수중 감시 및 정찰 임무에 혁신적인 발전을 가져올 잠재력을 가지고 있습니다.