
微软正式扩展其 MAI 人工智能模型家族,推出首款流式转录模型 MAI-Transcribe-2-Streaming,并同步发布两款文本转语音(TTS)模型。此举旨在赋能开发者构建具备即时聆听与回复能力的语音助手,实现更接近人类自然交互的对话体验。
流式转录突破实时交互瓶颈
在新发布的三款模型中,MAI-Transcribe-2-Streaming 最具战略意义。该模型通过 WebSocket 接收语音输入,实时输出持续更新的转录文本,并在说话者停顿时确认最终内容。这一机制允许应用在用户说完请求前即开始处理需求,或实时显示字幕。
目前,MAI-Transcribe-2-Streaming 已上架 Vercel AI Gateway,定价为每小时音频 0.54 美元。它支持超过 60 种语言的自动检测,平均首个转录假设的响应时间为 320 毫秒。微软强调,实际响应速度受网络连接及后端生成系统影响,无法在所有场景下保证该性能指标。
相比之下,微软上月推出的非流式模型 MAI-Transcribe-2 定价仅为每小时 0.10 美元。由于无需在传输过程中不断返回临时结果,其成本比流式版本低五倍以上,但需等待发言完全结束后才开始处理。
补齐语音合成短板
除转录能力外,微软还发布了两款专注于文本生成语音的模型,以完善对话式 AI 代理的关键环节:
- MAI-Voice-2.1:侧重高表现力与高保真度输出,定价为每百万字符 22 美元;
- MAI-Voice-2.1-Flash:牺牲部分表现力以换取更低成本与更快响应,定价为每百万字符 15 美元。
这两款 TTS 模型均支持 23 种语言。
战略意图:降低对外部模型依赖
此次新品发布凸显了微软加速摆脱对 OpenAI 和 Anthropic 依赖的战略意图。尽管微软是这两家公司的重要投资者,但其人工智能首席执行官穆斯塔法·苏莱曼(Mustafa Suleyman)此前表示,对使用外部前沿模型的高昂成本日益担忧。
苏莱曼指出,向 Anthropic 等合作伙伴支付了巨额费用,因此目标是减少并最终消除这一成本。为此,他指示团队加大对 MAI 模型家族的投入,计划最终用自研模型驱动 Excel 和 Outlook 等平台上的 Copilot 智能体。
随着新模型的推出,微软已具备构建完整语音 AI 代理的技术闭环:MAI-Transcribe-2-Streaming 负责语音识别,大型语言模型 Mai-Thinking-1 负责推理决策,MAI-Voice 系列负责语音生成。这种模块化架构让开发者能对语音代理的质量、延迟和成本进行更精细的控制。