음성 인공지능(AI) 분야의 선두 주자인 일레븐랩스(ElevenLabs)가 최신 음성 모델인 v4와 v4 터보를 공개하며 음성 합성 기술의 새로운 지평을 열었습니다. 이번 업데이트의 핵심은 90개 이상의 언어 지원, 향상된 표현 제어 기능, 그리고 음성 에이전트를 위한 낮은 지연 시간입니다. 이는 기업 고객과 크리에이터 모두에게 더욱 유연하고 사실적인 음성 AI 경험을 제공할 것으로 기대됩니다.
일레븐랩스 v4 모델은 새로운 아키텍처를 통해 단 10초 분량의 오디오만으로도 음성을 복제(voice cloning)할 수 있게 되었습니다. 또한, 긴 텍스트에서도 음성 정체성(voice identity)을 일관되게 유지하며, 텍스트의 맥락을 이해하여 자연스러운 표현 변화를 적용합니다. v3에서 도입된 인라인 태그(inline tags)는 v4에서 더욱 확장되어 여러 태그를 중첩하여 사용할 수 있으며, 모델이 태그 순서를 따라가도록 개선되었습니다. 특히 일본어, 브라질 포르투갈어, 북경어, 광둥어 등 아시아 및 남미 주요 언어에서 음성 품질이 크게 향상되었다고 회사 측은 밝혔습니다.
이번 v4 모델은 특히 음성 에이전트(voice agent) 분야에서 큰 잠재력을 가집니다. 낮은 지연 시간 덕분에 대규모 언어모델(LLM)이 답변을 생성하는 즉시 오디오 생성을 시작할 수 있어, 보다 유동적인 대화가 가능해졌습니다. 또한, 모델이 고객의 불만, 갈등 상황, 대기(hold) 등을 다르게 처리하여 문제 해결 능력을 향상시킬 수 있습니다. 이는 고객 서비스, 교육, 엔터테인먼트 등 다양한 산업에서 음성 AI의 활용 범위를 넓히는 중요한 진전으로 평가됩니다. 일레븐랩스는 지난 한 해 동안 기업 고객 비중이 55% 이상으로 급증했으며, 연간 매출(annualized revenue run rate)도 3억 3천만 달러에서 6억 달러 이상으로 성장하는 등 빠르게 시장을 확장하고 있습니다.
