항공 교통 관제(ATC)는 비행 안전에 필수적인 대화형 작업으로, 다른 항공 교통 관리 시스템이 반자동화되는 동안에도 여전히 인간 관제사에 크게 의존하고 있습니다. 최근 한 연구팀이 대규모 언어모델(LLM)이 실제 운용 가능한 수준의 ATC 통신을 생성할 수 있는지 실험적으로 평가하여 그 가능성과 현재의 한계를 제시했습니다.
연구팀은 샌프란시스코 '베이 투어' 경로를 비행하는 일반 항공기에서 수동으로 전사한 통신 기록을 실제 데이터(P0)로 활용했습니다. 조종사 참여(pilot-in-the-loop) 과정을 통해 제약 수준이 다른 다섯 가지 프롬프트 구조(P1-P5)를 설계하고, 이를 다중 턴(multi-turn) 대화 파이프라인에 적용했습니다. 이 파이프라인에서 LLM은 누적되는 대화 이력을 기반으로 조종사의 고정된 통신 기록에 대해 ATC 역할을 수행했습니다. 아홉 가지 오픈소스 및 클로즈드소스 LLM을 대상으로 프롬프트, 다른 비행 기록의 예시 제공 여부, 그리고 모델이 이전 답변에 의존하는지 또는 실제 이력을 주입받는지 여부를 변경하며 실험했습니다. 통신 턴(turn)은 어휘, 구조, 의미론적 유사성 지표와 인간 전문가의 검증을 거친 LLM 평가자(GPT-5.5)를 통해 점수가 매겨졌습니다.
실험 결과, 작업 예시(worked example)를 제공하는 것이 유사성을 향상시키는 데 효과적이었지만, 프롬프트의 제약을 강화하는 것은 오히려 성능을 저하시켰습니다. 가장 가벼운 프롬프트가 최상의 성능을 보인 반면, 가장 복잡하게 스크립트된 프롬프트는 대화가 진행될수록 자체 오류가 누적되어 성능이 저하되는 현상을 보였습니다. 그러나 올바른 이력을 주입하면 이러한 오류 누적 문제가 해결되었습니다. 이 연구는 LLM 기반 ATC 시스템의 구체적인 개발 경로와 현재의 기술적 한계를 명확하게 보여주며, 미래 항공 관제 시스템의 발전 가능성을 시사합니다. 안전이 최우선인 항공 분야에서 LLM의 역할은 점진적으로 확대될 것으로 예상됩니다.