AI 음악 생성 서비스로 유명한 수노(Suno)가 이제 음성 생성 기능까지 선보이며 서비스 영역을 확장합니다. 새로 출시된 '스피치(Speech)' 기능은 사용자가 입력한 스크립트나 프롬프트 설명을 바탕으로 음성을 만들어주며, 동시에 배경 음악까지 함께 생성할 수 있는 것이 특징입니다. 이는 수노가 단순한 음악 생성기를 넘어 다양한 형태의 인간 표현을 지원하려는 비전을 보여주는 행보입니다.
수노의 스피치 기능은 현재 웹과 모바일 플랫폼에서 공개 베타로 제공됩니다. 사용자는 '생성(Create)' 탭에서 스피치 옵션을 선택할 수 있으며, 간단한 설명을 통해 원하는 음성을 만드는 '심플(Simple)' 모드와 직접 스크립트를 입력하는 '고급(Advanced)' 모드를 제공합니다. 고급 설정에서는 AI 음성의 성별, 말하기 스타일, 그리고 각 음성 생성의 다양성까지 조절할 수 있습니다. 최대 8분 길이의 음성 생성이 가능하며, 배경 음악은 선택 사항으로 필요에 따라 끌 수 있습니다. 수노는 이 기능이 아직 완벽하지 않지만, 사용자 피드백을 통해 지속적으로 개선해 나갈 것이라고 밝혔습니다.
음성 생성 기술 자체는 딥마인드(DeepMind), 어도비(Adobe), 일레븐랩스(ElevenLabs) 등 여러 기업에서 이미 제공하고 있습니다. 하지만 수노는 AI 음악과 음성을 하나의 응집력 있는 트랙으로 동시에 생성한다는 점에서 차별점을 가집니다. 이는 시 낭송에 잔잔한 배경 음악을 더하거나, 연설에 에너지를 불어넣는 등 특정 사용 사례에서 시너지를 낼 수 있습니다. 수노는 이번 스피치 기능 출시를 통해 플랫폼 다각화를 꾀하며, 저작권 소송 등으로 인한 기존 AI 음악 사업의 리스크를 분산하려는 전략으로도 해석될 수 있습니다. 사용자들은 이 새로운 기능을 통해 더욱 풍부하고 몰입감 있는 오디오 콘텐츠를 손쉽게 제작할 수 있을 것으로 기대됩니다.
