
10月1日,AI音乐生成平台Suno正式推出Speech功能的公开测试版。该功能旨在将有声读物脚本转化为包含原创背景音乐的统一音轨,而非后期拼接的独立旁白与配乐。
语音与音乐的深度融合
Suno首席产品官Jack Brody表示,Speech是首个将语音和音乐作为统一连贯音轨共同生成的音频模型。尽管音乐仍是Suno的核心,但公司视野已扩展至人类表达的其他形式。
这一发布紧随9月9日推出的v6音乐模型之后。经过一个月的小范围测试,目前所有Suno用户均可在网页端及iOS、Android设备上体验。官方承认,作为测试版,该功能偶尔会出现口音偏差或停顿过长等问题,但这些“瑕疵”可能激发意想不到的创造力。
两种创作模式
用户在“创建”选项卡中选择Speech后,可选择两种路径:
- 简单模式:输入简短描述(如“海盗船长激励船员”),系统自动生成脚本文字及匹配的管弦乐背景。
- 高级模式:允许输入完整自定义脚本,并可调整语音性别、说话风格及变化程度。
生成的音轨最长可达约八分钟,适用于短篇故事、冥想引导或产品展示。用户也可关闭音乐,仅输出纯人声。
差异化竞争与版权考量
与ElevenLabs、Adobe等专注于文本转语音或声音克隆的竞品不同,Suno的Speech并不克隆用户声音,而是根据提示创建全新的合成说话者。这一区别对于关注肖像权和版权问题的创作者至关重要。
Suno近期迭代迅速,从包含声音克隆的v5.5版本到Studio 2.0,再到v6模型,产品更新频繁。联合创始人Mikey Shulman透露,截至10月初,Suno年度经常性收入(ARR)已超过3亿美元,订阅用户突破200万。
挑战与展望
尽管效率提升显著,但Speech生成的音频仍带有机器特征,如措辞不自然或情感弧线不一致。此外,关于生成音频的商业使用条款尚不明确,且模型在处理受版权保护文本时可能面临新的审查。
行业观察认为,Suno正从单一音乐引擎转型为通用音频创作平台,降低了播客片头、营销配音等内容制作门槛。然而,当歌曲、旁白与原声带的界限在单一模型中消融,版权归属与伦理问题将成为行业关注的焦点。目前,该功能沿用现有信用计划,新定价方案尚未公布。