当地时间 10 月 1 日,AI 音乐制作平台 Suno 宣布推出 Speech,Suno 宣称这是业界首个能够将语音与音乐作为单一连贯音轨共同生成的音频模型。该模型并非像传统工作流那样先做 TTS(文本转语音)再拼接 BGM,而是端到端一体化生成,是首个能单次生成完整融合”语音朗读+原创 BGM”的端到端闭源音频模型。在过去一个月中,Suno 与小范围用户共同测试了该功能,现在正式面向所有人开放公测(Beta)。
当地时间 10 月 1 日,AI 音乐制作平台 Suno 宣布推出 Speech,Suno 宣称这是业界首个能够将语音与音乐作为单一连贯音轨共同生成的音频模型。该模型并非像传统工作流那样先做 TTS(文本转语音)再拼接 BGM,而是端到端一体化生成,是首个能单次生成完整融合”语音朗读+原创 BGM”的端到端闭源音频模型。在过去一个月中,Suno 与小范围用户共同测试了该功能,现在正式面向所有人开放公测(Beta)。