Google最新为其Gemini 3.8 Live模型推出“Live Avatar”(实时形象)功能,赋予对话式AI生动的面部表情与实时视频生成能力。目前,订阅Gemini Enterprise的企业客户可在网页、移动端及自助终端部署该功能,标志着企业级AI交互从纯语音向多模态视觉体验演进。

技术集成与多语言能力

Live Avatar基于Gemini 3.8 Live的低延迟语音对话能力,新增流式视频生成技术,实现口型、头部动作及表情与语音输出的精准同步。系统可并行处理音频、摄像头画面及屏幕共享内容,并在后台执行工具调用或数据库查询,确保对话流畅不间断。

该功能支持97种语言的自动检测与切换。Google声称,即便在英语与日语等语言间切换,虚拟形象仍能保持视频质量稳定,避免视觉漂移。演示显示,同一角色在不同语言下均能呈现准确的口型动画。

企业应用场景与定制

Google旨在通过增强数字智能体的“存在感”,助力银行、零售及服务行业引导客户完成复杂流程。早期演示中,虚拟形象在办理酒店入住时,既能后台提取预订数据,又能与客户进行自然的面对面式互动。

企业客户可从预设库中选择卡通或写实风格形象。此外,允许使用单张高质量参考照片创建自定义版本,但该功能目前仅对白名单用户开放。Gemini Live产品经理Fabien Blanc-paques表示,随着AI发展超越速度与成本指标,重点已转向提升交互质量。

安全措施与伦理争议

针对拟人化可能带来的信任风险,Google在生成的音视频中嵌入了不可见的SynthID水印,并实施严格控制以防止滥用真实人物肖像。自定义形象需经企业批准,且输出内容常附带免责声明。

尽管技术同步性获认可,但分析人士指出,富有表现力的面孔可能使用户高估AI能力,尤其在模型产生幻觉时易引发错误信任。Google内部研究亦曾警示类人接口可能滋生虚假信心。因此,建议将连续交互控制在短时段内,并加强对员工的技术培训及客户披露政策。

此次发布建立在Google Cloud Next大会预览及Project Astra多年研究基础之上。相较于Meta及初创公司的类似尝试,Google凭借庞大的Gemini部署基础、广泛语言支持及工具调用整合能力,试图在客户服务与销售场景中建立差异化优势。纯语音AI智能体时代正加速终结,视觉存在的引入将重新定义人机交互标准。