Google今日推出两款新模型,将近实时推理能力应用于语音代理,旨在提升人工智能对话的直观性与智能水平。

  • Gemini 3.8 Live:专为规模化部署与成本效率设计,兼具对话智能、流畅交互及视觉定位能力。
  • Gemini 3.8 Live Extended Thinking:面向高复杂度任务,具备更高智能水平及多步推理能力。

对于开发者和企业,这些模型提供了构建可靠、可投入生产的语音代理基础模块。同时,Gemini应用、Google Workspace及搜索功能中的语音交互体验也将更加流畅协作,支持仅凭语音处理复杂任务。

更流畅、智能的对话体验

Gemini 3.8 Live Extended Thinking提供企业级任务完成能力。在Artificial Analysis“语音到语音质量指数”中,该模型以82.6分综合排名第一;在代理任务完成率方面处于领先地位,τ-Voice基准测试得分68.6%,Sierra τ-Voice-banking基准测试得分35.1%。此外,其在Big Bench Audio测试中得分97.7%,展现出强大推理能力,且价格极具竞争力。

Gemini 3.8 Live在Speech Agent Arena中排名第二,深受用户青睐。该模型在保持高性能的同时具备极高成本效益,专为规模化部署打造。

在ServiceNow EVA-Bench基准测试中,相关模型通过平衡准确性与对话质量,推动了复杂工作流的帕累托前沿(基于Gemini Enterprise Agent Platform上的Live API运行结果)。

Gemini 3.8 Live支持近乎实时的视觉输入处理,通过丰富上下文提供更精准回答,并能在对话中自动检测及切换97种支持语言。模型可在后台执行工具和API调用的同时维持对话状态,实现请求确认与聊天并行。

针对需要深度推理的任务,3.8 Live Extended Thinking支持推理与语音输出同步进行。它在保持对话流不间断的同时,通过“让我查一下……”等早期语音提示自然确认指令,并实时播报多步后台任务进展,为复杂工作流提供增强智能支持。

赋能开发者与企业生态

借助Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel和Vision Agents等平台可帮助开发者轻松构建高性能语音驱动界面,由平台底层管理实时媒体流基础设施,使开发者专注于用户体验。

Google已与Salesforce、Genspark和Lumeris等企业建立合作伙伴关系。这些企业对3.8 Live系列模型的低延迟、流畅性及工具调用能力表示认可。

SynthID水印确保透明度

所有AI产品生成的音频均嵌入不可察觉的SynthID水印,确保AI生成内容可被检测,以防范虚假信息。详细安全与责任方法请参阅模型卡片。

获取最新Gemini音频模型

Gemini 3.8 Live今日陆续上线:

  • 开发者:Gemini API和Google AI Studio
  • 企业:Gemini Enterprise私有预览版,即将登陆Gemini Enterprise for Customer Experience
  • 公众:Search Live

Gemini 3.8 Live Extended Thinking今日陆续上线:

  • 开发者:Gemini API和Google AI Studio
  • 企业:Gemini Enterprise私有预览版,即将登陆Gemini Enterprise for Customer Experience及Google Workspace商业客户
  • 公众:Gemini Live,Workspace Docs的Google AI Pro和Ultra订阅用户,以及Gmail和Keep中的所有Google AI订阅用户