AI音乐生成平台Suno正式拓展业务边界,推出全新“Speech”功能。该功能允许用户基于脚本或提示词生成人声,并自动搭配AI背景音乐。目前,Speech功能已在Suno网页端和移动端开启公开测试。

首创音轨统一生成模式

Suno首席产品官Jack Brody表示,音乐虽是Suno的构建基础,但公司的愿景涵盖更广泛的人类表达形式。Speech是业界首个将语音和音乐作为统一音轨共同生成的音频模型,旨在探索音乐之外的应用场景。

尽管DeepMind、Adobe及ElevenLabs等已在文本转语音(TTS)领域深耕多年,Suno此举意在通过差异化竞争实现平台多元化,以缓解其核心音乐生成业务面临的法律诉讼压力。

与单纯生成人声不同,Speech强调语音与背景乐的融合。用户可根据需求选择关闭背景音乐以获取纯净人声,或利用组合效果增强表现力,例如为诗歌配乐或为演讲营造氛围。

提供简易与高级双模式

在操作层面,用户进入“Create”选项卡下的Speech模块后,可选择两种生成模式:

  • Simple模式:通过自然语言提示框描述场景,如“一名海盗船长正在激励船员”。
  • Advanced模式:支持输入自定义脚本以精确控制内容,并可调整语音性别、风格及生成多样性。

该功能单次生成时长上限约为8分钟。

Suno坦言,作为Beta测试版本,Speech尚存瑕疵。Brody指出,系统偶尔会出现英式与澳式口音混淆、戏剧性停顿过度夸张等情况,但团队将根据用户反馈持续迭代优化,并期待发现更多意想不到的应用案例。