항공 시각-언어 내비게이션(VLN) 에이전트, 즉 드론과 같은 자율 비행체가 사용자 명령을 이해하고 따르는 데 큰 어려움을 겪어왔습니다. 이는 에이전트가 훈련받은 상세하고 경로에 정렬된 명령과, 사용자가 일상적으로 내리는 짧고 의도 중심적인 명령 사이에 큰 '명령 간극(instruction gap)'이 존재하기 때문입니다. 일례로, 'OpenFly' 내비게이터의 경우, 이 간극으로 인해 성공률(SR)이 31.03%에서 11.33%로 급락하는 문제가 발생했습니다.
이러한 문제를 해결하기 위해 연구팀은 '경로 기반 명령 번역기(Trajectory-Grounded Instruction Translator, TGIT)'를 개발했습니다. TGIT는 내비게이터 에이전트를 수정하지 않고 전면에 배치되어, 사용자의 의도 중심적인 명령을 에이전트가 실행할 수 있는 명령으로 번역하는 역할을 합니다. 이를 위해 연구팀은 언어 모델(LM)에 사람이 작성한 스타일 예시를 프롬프트로 제공하여, 기존의 상세 명령을 의도 중심적인 '약한 명령(Weak commands)'으로 변환하는 방식으로 번역기 훈련 데이터를 확장했습니다. 이 약한 명령으로 훈련된 번역기는 약한 입력에 대한 성공률을 15.27%에서 37.93%로 크게 향상시켰습니다.
더욱 중요한 점은, TGIT가 실제 사람의 명령에 대해서도 제로샷(zero-shot) 방식으로 성공률을 11.33%에서 32.51%로 끌어올렸다는 것입니다. 이는 별도의 추가 훈련 없이도 실제 사용자 환경에서 효과적으로 작동함을 의미합니다. 또한, 기존 'OpenFly' 데이터셋에서는 4.95%에 불과했던 성공률을 20.79%로 개선했으며, 'CityNav' 및 'AirVLN'과 같은 다른 VLN 플랫폼에서도 성능 회복을 보였습니다. 이 기술은 드론이 복잡한 환경에서 사람의 지시를 더 정확하게 이해하고 임무를 수행할 수 있도록 하여, 물류, 감시, 수색 및 구조 등 다양한 분야에서 드론의 활용도를 높일 잠재력을 가지고 있습니다.