음성 인공지능(AI) 분야에 수십억 달러의 투자가 쏟아지며 차세대 인터페이스로 주목받고 있지만, 업계 전문가들은 아직 갈 길이 멀다고 입을 모읍니다. 매주 새로운 모델과 도구가 출시되며 인간처럼 자연스러운 대화를 표방하지만, 실제로는 기대에 미치지 못하는 경우가 많다는 지적입니다. 특히 양방향 대화(full-duplex) 모델의 등장에도 불구하고, 음성 AI는 아직 챗GPT(ChatGPT)와 같은 혁신적인 순간을 맞이하지 못했다는 평가가 나옵니다.
기업용 음성 AI 플랫폼 폴리AI(PolyAI)의 CTO 숀 웬(Shawn Wen)은 음성 AI의 다음 과제로 '빠른 추론(reasoning)'을 꼽았습니다. 모델이 질문에 신속하게 답하고 대화가 자연스럽게 이어지려면 추론 속도 개선이 필수적이라는 설명입니다. 또한, 고객 서비스 AI 상담원은 로봇처럼 들리지 않아야 하며, 문제 해결에 대한 신뢰를 줄 수 있어야 한다고 강조했습니다. 회의록 작성 AI 오터(Otter)의 CMO 알렉스 게이(Alex Gay)는 화자 식별, 의도 파악, 그리고 조직 지식과의 연동이 자동화를 위한 핵심 단계라고 언급했습니다. 그는 감성적인 표현까지 재현하는 '디지털 트윈(digital twin)' 기술이 중요하며, 그렇지 않으면 단순한 질의응답 챗봇에 불과하다고 덧붙였습니다.
이러한 한계의 근본 원인으로는 음성 AI 모델의 이해력과 투명성 부족이 지목됩니다. 자동 음성 인식(ASR) 모델이 중요한 키워드를 놓쳐 전체 맥락 파악에 실패하는 경우가 잦다는 것이 웬 CTO의 설명입니다. 오터의 게이 CMO 역시 부정확한 초기 전사(transcription)는 모든 후속 작업의 오류로 이어져 플랫폼에 대한 신뢰를 잃게 만들므로, ASR 모델 개선이 매우 중요하다고 강조했습니다. 또한, 사용자가 AI와 대화 중이거나 녹음되고 있음을 명확히 알리는 투명성 확보도 중요한 과제로 떠오르고 있습니다. 결국 음성 AI가 진정한 잠재력을 발휘하려면 단순한 기술적 진보를 넘어, 인간의 대화 맥락과 감성을 이해하고 신뢰를 구축하는 방향으로 발전해야 할 것입니다.