
谷歌今日通过云平台正式发布两款全新文本转语音(TTS)模型:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。两款模型 API 高度兼容,便于开发者并行调用,但在定位上各有侧重。
Flash-Lite TTS 专为成本效益和推理速度优化;Flash TTS 则以更高定价提供卓越音频质量,适用于有声书制作等高保真场景。语言支持方面,Flash TTS 首发支持 130 种语言,Flash-Lite TTS 支持 101 种。
高度可定制的语音生成
两款模型均提供超过 2,000 种预置声音库。开发者可通过自然语言提示调整音色、口音和语速,或基于 30 秒音频样本生成合成声音。谷歌强调,使用样本克隆前必须获得说话人授权。未来,公司还计划增加基于预置选项修改创建新声音的功能。
在表达方式上,开发者可在脚本中嵌入“演讲提示符”(oratory cues),以控制非词汇发声和语速变化,从而定制 AI 说话人的情感与节奏。
安全水印与性能基准
为保障内容安全,谷歌利用 SynthID 技术在生成语音中嵌入人耳不可见但机器可识别的音频水印,并为每个文件附加 C2PA 记录,注明生成时间及修改历史。
性能评估显示,在初创公司 Hume AI 开发的音频质量基准测试中,Flash TTS 和 Flash-Lite TTS 分获第一、第二名。在基于人类反馈的 Voice Arena 基准测试中,两款模型在多种语言下的表现也优于多个竞品。
谷歌员工 Leland Rechis 和 Alan Cowen 表示,这些模型旨在为创作者和企业提供更丰富的音频体验,并提升 Gemini Notebook 和 Google Vids 等产品的用户体验。此次发布进一步扩充了谷歌的音频处理模型阵容,此前公司已推出针对语音代理、转录和翻译优化的算法。