谷歌正式推出两款 Gemini 3.8 Flash TTS 语音模型,引入专为高性能脚本生成和高音量音频制作设计的专用系统。此次发布将语音合成任务划分为创意导向与成本可控的基础设施两类。

Gemini 3.8 Flash TTS 面向互动娱乐、游戏开发及长篇旁白,满足工作室基于提示词进行语音设计的需求;Gemini 3.8 Flash-Lite TTS 则专注于自动化媒体配音、客户对话代理及高吞吐量翻译流水线。

新模型扩展了谷歌现有的音频产品矩阵,旨在取代此前包含 30 种声音的固定目录。开发者现可访问拥有超 2,000 个预建语音档案的库,涵盖魁北克法语、苏格兰英语等 100 多种语言的地区性变体。未来推出的语音混音模块将支持通过文本命令直接调整音色、音调、节奏及口音。

基准测试表现优异

独立评估显示,Gemini 3.8 Flash TTS 在 Hume AI 语音设计基准测试中以 71.4 分位居总榜第一,并在口音建模类别中以 60.8 分领先。在总体质量指数中,Flash 模型排名第一,Flash-Lite 紧随其后,均优于早期的 Gemini 3.1 Flash TTS 基线。

Voice Arena 盲测证实,该模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等地区语言中具有偏好优势。其核心功能包括多说话人场景设置与长篇幅合成:单个脚本即可引导双人对谈,保持自然的轮替与声音分离;在数小时长的音频中,角色音色保持稳定,有效减少有声书和播客录制中的音质衰减。

此外,创作者可在文本中插入 <laughs>(笑)、<sigh>(叹气)等非语言声学标记,以及 |mhm|、|yeah| 等反应性感叹词,以精准控制对话节奏。

安全机制与企业级部署

为应对模仿风险,语音克隆流程实施强制性身份检查。重建语音档案需提交 30 秒参考录音及原所有者明确口述同意的语音轨,系统将验证两段音频的声学一致性。生成的音频文件嵌入不可见的 SynthID 水印及加密 C2PA 来源元数据,确保下游工具可识别合成资产。

目前,这两款模型已在企业环境中部署。开发者可通过 Google AI Studio 和 Gemini API 调用,并接入由 Agora、LiveKit、Pipecat 和 Vercel 支持的框架。早期商业集成伙伴包括 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang,用于区域媒体翻译和客服自动化。

终端用户可直接在 Gemini Notebook 中使用 Flash TTS,Google Vids 则集成了 Flash-Lite TTS。Gemini Enterprise 客户将在后续部署中获得管理 API 访问权限。