小米今日宣布发布并开源MiMo-V2.6系列生成式人工智能模型。该系列包含两款原生全模态模型,旨在平衡智能水平、运行效率与成本。

MiMo-V2.6系列包括旗舰型号MiMo-V2.6-Pro,以及更轻量高效的Flash版本。此外,小米还推出了精简版Pro-UltraSpeed,在保持同等质量的前提下,其输出速度比Pro快20倍,以满足极致生成速度的需求。

Pro和Flash被定义为原生“全模态”模型,能够同时处理文本、图像、视频和音频输入,并支持100万token的上下文窗口。Pro的架构包含一个6.81亿参数的视觉编码器,其中整合了3.08亿参数的AudioTokenizer和1.27亿参数的音频patch编码器,具备语音区分能力。

这种设计使模型能更好地适应代理式AI(Agent AI)用例,特别是在计算机操作领域。例如,计算机使用代理可在单次模型循环中读取任务指令、分析UI截图或视频帧,进行推理并决策下一步行动。编程或设计代理则能将源代码、仓库上下文与截图、UI原型及参考图像结合在同一会话中。在商业场景下,该模型可直接处理包含通话音频、截图、日志和笔记在内的多模态文档,无需额外工具分解转录内容或协调不同模态。

小米在公告中展示了该模型在游戏世界构建、基于Blender的3D建模、具身模拟和视频音乐工作流中的表现。

性能对标与成本优势

在Artificial Analysis Intelligence Index测试中,V2.6-Pro得分为46.32,超过Kimi K3和Qwen3.8 Max,成为该榜单排名最高的开源/开放权重模型。但在综合指标上,该模型仍落后于 proprietary 闭源旗舰模型Claude Fable 5.1和GPT-6 Astra。

在代理任务方面,V2.6-Pro表现接近或偶尔超越领先的闭源系统:在AutomationBench上得分为53.1(Claude Opus 5为50.3);在Agents’ Last Exam上得分为31.6,与Opus 5持平;在Terminal Bench 2.1上得分为89.9,略高于Opus 5的89.1。

小米表示,V2.6系列将沿用MiMo-V2.5的标准API定价。Pro和Flash模型可通过小米AI Studio、MiMo Desktop、MiMo Code以及OpenRouter访问,其中OpenRouter支持105万token上下文。

具体定价如下:V2.6-Flash输入价格为每百万token 0.14美元,输出为0.28美元;Pro输入价格为0.435美元,输出为0.87美元。Pro-UltraSpeed因速度快20倍,价格分别为4.35美元和8.70美元。

小米声称,考虑到缓存token成本显著降低,Pro的成本大致仅为海外同类智能水平模型的二十分之一到六十分之一。相比之下,OpenAI Group PBC的GPT-6 Astra和Anthropic PBC的Claude Fable 5.1每百万token的输入和输出价格在10至50美元之间。对于重度依赖缓存的代理应用,这一成本差距将进一步扩大。