
2026年9月28日,ElevenLabs正式发布Eleven v4和Eleven v4 Turbo模型。该公司称,这标志着文本转语音(TTS)技术的代际分水岭:系统不再简单地将单词映射为音频,而是在合成首个音节前,先解读文本的演绎方式。ElevenLabs测试显示,Turbo模型的首次语音输出中位时间约为150毫秒。第三方机构Artificial Analysis指出,其性能处于当前商业语音模型的领先层级。
架构变革:从音素映射到语境理解
自20世纪中叶以来,TTS技术经历了拼接式合成、基于共振峰合成、统计参数合成及神经波形合成四个阶段。尽管DeepMind的WaveNet及后续的Tacotron、HiFi-GAN实现了端到端神经TTS管道,但传统模型仍在句子层面运作,副语言线索主要依赖标点和SSML标记。
Eleven v4的核心差异在于上下文、角色和场景层面的文本解读。模型在确定声学输出前,会处理前文、角色身份和叙事基调。例如,“I need you to stay calm”这句话,由医生传达诊断时与小队指挥官在交火前吼出时,应具有不同的声学特征。v4旨在自动实现这种基于语境的区分,而非依赖显式标记。
基准测试:Elo评分领跑行业
ElevenLabs声称,在盲听对比中约75%的听众偏好Eleven v4,但该数据未公布详细方法论。更具参考价值的是第三方排行榜Artificial Analysis Provider Voice Arena的数据。截至2026年9月,Eleven v4以1319分的Elo得分位居第一,显著高于第二名Cartesia Sonic 3.6的1276分,且差距超出置信区间重叠范围,具有统计学意义。
尽管主观偏好测试存在变量,但这一独立排名为开发者提供了可验证的性能参考。
自然语言指令与低延迟突破
针对复杂交付需求,v4引入了改进的内联标记系统。开发者可使用方括号插入自然语言指令,如[laughs](笑)、[said angrily in French accent](用法语口音愤怒地说)。相比仅能控制韵律的SSML,这种方式能更准确地表达角色情感和情境指令,适用于游戏、有声书等场景。此外,v4还改进了国际音标(IPA)音素定制,以更精细地控制人名、口音和技术术语的发音。
在延迟方面,Eleven v4 Turbo的中位推理延迟约为100毫秒,首次语音输出中位时间约为150毫秒。心理学研究显示,人类对话的平均回合间隔约为200毫秒。这意味着TTS组件本身已不再是对话自然度的瓶颈。然而,包含语音转文本(STT)和大语言模型(LLM)推理的全管道中位延迟仍约为680毫秒。因此,系统整体体验的上限现已转移至STT和LLM组件。
ElevenLabs将v4 Turbo与其对话代理平台ElevenAgents协同优化,主张垂直整合比组装多供应商组件更具一致性,但这一主张尚未得到第三方独立验证。
跨语言克隆与法律风险并存
v4系列将多语言支持扩展至90多种语言,并解决了跨语言声音克隆中的“口音漂移”问题。通过解耦音色与音系习惯,模型能让克隆声音在生成西班牙语、日语等目标语言时,保留说话者音色但采用当地口音,而非带有源语言口音。
在功能更新上,即时声音克隆所需的最小音频样本降至10秒,并支持更高保真度的专业声音克隆。然而,强大的克隆能力也伴随着法律争议。2026年5月,伊利诺伊州北区法院受理了针对ElevenLabs的集体诉讼(Amer v. Eleven Labs),指控其在未获书面同意的情况下收集语音数据并用于训练。此外,参议员Maggie Hassan于2026年4月致信质询其防欺诈措施。FBI 2025年互联网犯罪报告显示,AI辅助的声音克隆欺诈造成约8.93亿美元损失。ElevenLabs表示已实施检测和水印功能,但未就具体诉讼置评。
定价与可用性
Eleven v4和v4 Turbo已通过ElevenAgents、ElevenCreative和ElevenAPI三个平台上线,免费账户亦可访问。公司未宣布特定的模型定价变更,使用量仍按现有的基于字符的结构计费。