一、产品概览:手机巨头的 AI 赌注
2026 年 4 月 28 日,小米正式开源 MiMo-V2.5 系列——这一天,全球大模型竞争格局再次被搅动。一家以手机和电动汽车著称的消费电子巨头,推出了参数量高达万亿的大语言模型,并以最宽松的 MIT 许可证向全世界开放权重。这不仅是小米的 AI 宣言,更是中国开源大模型阵营向全球顶尖闭源模型发起的最新冲击。
MiMo V2.5 系列包含两个独立模型:MiMo-V2.5(310B 参数,15B 激活,原生全模态)和 MiMo-V2.5-Pro(1.02T 参数,42B 激活,重点攻克复杂 Agentic 任务)。两款模型均支持 100 万 token 的超长上下文窗口,均采用稀疏混合专家(MoE)架构与混合注意力机制,并在 API 和 Hugging Face 上同步对外开放。
2026 年 3 月 11 日,OpenRouter 平台上突然出现一个匿名模型"Hunter Alpha":万亿参数、100 万 token 上下文,完全免费。七天内处理超过 1 万亿 token,压过 Claude Opus 4.6 和 GPT-5.4 成为当日流量榜首。社区普遍猜测这是 DeepSeek V4。3 月 18 日,小米 MiMo 负责人罗福理揭秘:那是 MiMo V2-Pro 的内测版本。小米股价当天暴涨 5.8%。
二、模型架构深度解析
MiMo V2.5 系列在架构设计上有多项工程亮点,值得深入拆解:
2.1 混合注意力机制(Hybrid Attention)
V2.5-Pro 采用滑动窗口注意力(SWA)与全局注意力(GA)6:1 交错的混合架构,结合 128 token 的滑动窗口。这一设计使 KV 缓存存储减少近 7 倍,同时通过可学习的注意力 sink bias 保持长序列性能。用通俗的话说:模型在大多数时候只"细看"附近的上下文,偶尔才做全局扫视,从而以极低的内存代价维持 100 万 token 的长程理解能力。
2.2 多 Token 预测(MTP)
与传统的推测解码不同,MiMo V2.5-Pro 配备了 3 个轻量级 MTP 模块,使用密集 FFN 网络原生集成于训练和推理中。这意味着模型在生成每个 token 时,可以同时预测接下来的多个 token,大幅提升推理吞吐量,实测输出速度约 65.8 tokens/秒。
2.3 三阶段后训练范式(MiMo V2.5-Pro)
V2.5-Pro 继承了 MiMo V2-Flash 引入的三阶段后训练:首先是通用能力对齐;其次是领域专项训练,分别针对数学、安全、代码、Agentic 工具调用等场景使用领域特化 RL 奖励独立优化;最后通过多教师在线策略蒸馏(MOPD),在单一学生模型中融合所有专家能力。
三、基准测试成绩深度分析
以下基准数据均来自 Hugging Face 官方 Model Card 及第三方测评机构 Artificial Analysis,测评时间截至 2026 年 4-5 月。
从数据看,MiMo V2.5-Pro 在代码能力上表现最为亮眼:SWE-bench Verified 达到 78.9%,SWE-bench Pro(更难的真实创业公司代码库修复任务)达到 57.2%,均处于全球第一梯队。GSM8K 近满分(99.6%)说明基础数学推理能力极强,但 HLE(困难知识问答)仅 48% 显示其对高难度跨领域知识题的掌握还有提升空间。
Artificial Analysis Intelligence Index 综合评分 54 分,在同体量开源模型中排名靠前(同类中位数 33 分),但评测过程中发现该模型输出较为冗长:同类模型平均生成 4100 万 token,而 V2.5-Pro 生成了 9200 万 token,属高词汇量模型,在计费场景下需留意 output cost。
四、MiMo-V2.5(多模态版)能力解析
与 Pro 版专注代码不同,MiMo-V2.5 是一个原生全模态模型:单一架构内原生理解文本、图像、视频和音频,无需多个独立模型拼接。这是相对于上一代 MiMo-V2-Omni 的重要升级。
值得注意的是,V2.5 在视频理解(Video-MME 87.7)和图表理解(CharXiv RQ 81.0,接近 GPT-5.4 的 81.2)上表现尤为突出,可与 Gemini 3 Pro 比肩。ClawEval 多模态子集得分 23.8 则说明纯多模态 Agentic 任务仍有较大提升空间,是该版本的短板之一。
五、Agentic 能力:自主完成工程壮举
MiMo V2.5-Pro 最引人注目的不是单点 benchmark,而是其在真实工程任务中展现出的自主执行能力。小米公开了三项具有代表性的实验:
北京大学编译原理课程项目级别任务:从零实现 SysY 语言的完整编译器,包括词法分析器、语法分析器、AST、Koopa IR 代码生成、RISC-V 汇编后端和性能优化。北大 CS 学生通常需要数周完成。MiMo V2.5-Pro 在 4.3 小时内、672 次工具调用后,以满分 233/233 通过所有隐藏测试用例。
从简单提示出发,自主构建具备多轨时间线、片段剪辑、交叉淡化、音频混合和导出管线的桌面视频编辑应用。最终产出 8192 行代码,历时 11.5 小时,共计 1868 次工具调用。
研究生级别模拟电路任务:在台积电 180nm CMOS 工艺下设计 FVF-LDO(翻转电压跟随器低压差稳压器),需同时满足相位裕量、线性调整率、负载调整率、静态电流、PSRR 和瞬态响应六项指标。接入 ngspice 仿真环境约一小时后,四项关键指标相较初次设计提升了一个数量级。
六、产品生态与部署支持
MiMo V2.5 系列发布当天即获得主流推理引擎的"Day-0"支持:SGLang 和 vLLM 均已适配。硬件方面,小米与 AWS、AMD、T-HEAD 和燧原等合作,模型可在从云端 H100 到国产加速器的各类硬件上高效运行。
对于 Agentic 框架集成,V2.5-Pro 已官方适配 OpenCode Go、OpenClaw、KiloCode、Blackbox 和 Cline。使用 Claude Code 的开发者可通过设置 ANTHROPIC_BASE_URL 指向小米端点来路由请求。OpenRouter 也提供同步支持(路径:xiaomi/mimo-v2.5-pro)。
七、定价策略全面解析
定价是 MiMo V2.5 系列最具冲击力的竞争武器之一。核心数据如下:
| 模型 | 输入($/M tokens) | 输出($/M tokens) | 上下文 | 开源 |
|---|---|---|---|---|
| MiMo-V2.5 | $0.40 | $2.00 | 1M | ✅ MIT |
| MiMo-V2.5-Pro | $1.00 | $3.00 | 1M(256K+ 翻倍) | ✅ MIT |
| Claude Opus 4.6 | $5.00 | $15.00 | 200K | ❌ |
| GPT-5.4 | $5.00 | $30.00 | 128K | ❌ |
| Gemini 3.1 Pro | $2.50 | $10.00 | 1M | ❌ |
注意事项: V2.5-Pro 在上下文超过 256K token 时,输入/输出价格翻倍($2.00/$6.00)。小米同时推出"Token Plan"订阅制,年费从 $63.36(7.2 亿积分)到 $1056(192 亿积分)分四档。限时优惠包括 100 万亿免费 token 及缓存写入免费。
八、与主要竞品横向对比
雷达图揭示了 MiMo V2.5-Pro 的核心优劣势:代码能力和数学推理是其最强的维度,Agentic 任务与顶级闭源模型基本持平;但作为纯文本模型,多模态能力为零,这也是其与同期 V2.5(多模态版)的核心分工所在。
九、实际使用体验:优势与不足
✅ 突出优势
- 超强代码 Agent:SWE-bench Verified 78.9% 和 SWE-bench Pro 57.2% 处于全球顶尖水平,真实工程任务中表现卓越
- 极致性价比:V2.5-Pro $1/M 输入 token,仅为 Claude Opus 4.6 的 1/5
- Token 效率高:完成同类任务消耗 token 比竞品少 40-60%,变相进一步降低成本
- 超长上下文:原生 1M token,GraphWalks 长上下文测试中远超 V2-Pro,在 512K 处仍能保持稳定推理
- MIT 开源:无任何授权限制,可商业使用、私有部署、二次微调
- Day-0 生态支持:SGLang、vLLM、OpenRouter 同日支持,国产加速器兼容
⚠️ 主要不足
- 输出冗长:Artificial Analysis 测评中生成了 9200 万 token,是同类平均的 2.2 倍,高 output cost 在大规模调用中需注意
- 思考时间较长:部分用户反映 V2.5-Pro 在复杂任务上的"思考时间"过长,影响响应体验
- 复杂 bug 自愈能力有限:在无明确错误反馈时,对细微 bug 的自主定位和修复能力不如 DeepSeek V4 Pro
- 256K 以上费用翻倍:超长上下文任务的价格优势大幅收窄
- V2.5-Pro 不支持多模态输入:仅文本,图像/视频/音频需使用 V2.5 版本
- AI Studio 访问受限:发布初期 AI Studio 端访问不稳定,主要通过 API 使用
十、开发者生态与战略意义
MiMo 项目由前 DeepSeek 核心成员罗福利主导,其在 DeepSeek R1 和 V 系列上的经验直接影响了 MiMo 的后训练策略。自 2025 年 12 月 MiMo V2-Flash 开源以来,短短四个多月内完成了 V2-Flash、V2-Pro/Omni/TTS 三件套、V2.5 系列共四次主要发布。
数据层面:截至 2026 年 4 月初,小米 MiMo 模型占据 OpenRouter 21.1% 的流量,约为 OpenAI 7.5% 份额的三倍,且还在以每周 42% 的速度增长。小米 CEO 雷军在 V2-Pro 发布次日宣布三年投入 87 亿美元的 AI 战略。Hunter Alpha 事件之后,小米已证明其有能力将 AI 模型与商业策略、用户口碑高度整合。
十一、总结评分
综合代码能力、Agentic 表现、定价竞争力、开放程度和生态完整性,我们给出如下评分(满分 5 分):
| 评测维度 | MiMo V2.5 | MiMo V2.5-Pro | 评分说明 |
|---|---|---|---|
| 代码 / 工程能力 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | SWE-bench 顶尖,Agentic 工程任务卓越 |
| 多模态理解 | ⭐⭐⭐⭐ | N/A | V2.5 视频图表理解媲美 Gemini 3 Pro |
| 定价竞争力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | 同级性能最低价,256K 内极具优势 |
| 开放程度 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | MIT 许可,完整权重公开 |
| 知识覆盖度 | ⭐⭐⭐ | ⭐⭐⭐ | HLE 48%,高难度跨域知识题仍有差距 |
| 综合评分 | 4.2 / 5 | 4.4 / 5 | 代码+Agent 第一梯队,性价比王者 |
十二、谁应该使用 MiMo V2.5 系列?
- 代码 Agent 开发者:V2.5-Pro 是目前开源模型中 SWE-bench 成绩最高的选项之一,自主工程能力明显,推荐优先尝试
- 多模态应用开发者:V2.5 原生支持图像/视频/音频,CharXiv RQ 和 Video-MME 成绩具有竞争力,且仅 $0.40/M token
- 成本敏感的企业:同等代码/Agent 能力下,MiMo 系列比闭源竞品便宜 5-12 倍,结合 token 效率优势,实际成本差距更大
- 私有部署需求方:MIT 开源 + SGLang/vLLM 支持 + AMD/国产加速器兼容,自托管门槛大幅降低
- 暂不推荐的场景:需要稳定多模态 Agentic 能力的任务(V2.5-Pro 不支持),或对模型"思考时间"敏感的实时交互场景
总结:MiMo V2.5-Pro 是 2026 年开源 AI 模型中性价比最突出的代码/Agentic 旗舰之一。以 Claude Opus 4.6 五分之一的价格,它在 SWE-bench 等关键代码基准上达到相当甚至更优的水平,并配以真正宽松的 MIT 许可证。小米用一部手机厂商的速度,在 AI 模型领域打出了一场漂亮的"降维打击"。
本评测报告生成过程使用到 AI 技术