오웬 송(Owen Song)이 1천만 개 미만의 파라미터(매개변수)로 구동되는 초경량 영어 텍스트-음성 변환(TTS) 모델 '인플렉트 마이크로 v2(Inflect-Micro-v2)'를 허깅페이스(Hugging Face)에 공개했습니다. 이 모델은 935만 6,513개의 파라미터와 37.53MB의 작은 용량으로, CPU 환경에서도 실시간보다 6배 이상 빠르게 음성을 합성할 수 있어 엣지 AI(Edge AI)나 로컬 기기에서의 활용에 최적화되어 있습니다.
인플렉트 v2는 마이크로(Micro)와 나노(Nano) 두 가지 버전으로 제공되며, 마이크로 버전은 1천만 파라미터 미만에서 음성 품질을 우선시하고, 나노 버전은 4백만 파라미터 미만에서 용량을 최소화하는 데 중점을 둡니다. 이 모델은 고정된 음색의 영어 TTS를 지원하며, 확정적 시드(deterministic seeds), 긴 텍스트 처리, 그리고 CPU 또는 CUDA 추론(inference)을 모두 지원합니다. 특히, 인간 선호도 평가에서 66.2%의 높은 선호율을 기록했고, ASR(자동 음성 인식) 오류율도 경쟁 모델 대비 낮은 수준을 보여 작은 크기에도 불구하고 뛰어난 음성 명료도를 자랑합니다.
이처럼 초경량 모델이 높은 성능을 보인다는 것은 대규모 클라우드 인프라 없이도 고품질의 음성 합성 기능을 다양한 기기에서 구현할 수 있음을 의미합니다. 이는 개인 개발자나 스타트업이 비용 부담 없이 음성 인터페이스를 제품에 통합하거나, 인터넷 연결 없이도 작동하는 오프라인 음성 애플리케이션을 개발할 수 있는 새로운 기회를 제공합니다. 향후 다국어 및 다양한 음색 지원이 추가된다면 활용 범위는 더욱 넓어질 것으로 기대됩니다.
