2026 年开年以来,中国大模型赛道掀起密集的发布潮。阿里巴巴的 Qwen3.5 在 2 月率先亮相,以混合 MoE 架构和原生多模态能力拉开序幕;清华系的 GLM-5(Z.ai)紧随其后,744B 参数、MIT 许可、华为昇腾芯片加持,成功打破"必须 NVIDIA"的定律;DeepSeek 则在 4 月底投下重磅炸弹,推出 DeepSeek-V4 Pro/Flash 双系列,凭借 1M 上下文与极致性价比再掀"第二次 DeepSeek 时刻"。
本文基于截至 2026 年 5 月的最新公开数据,从架构创新、基准测试、定价策略到实际体验,对三款模型展开全维度横向评测,帮助开发者与企业做出更精准的选型决策。
一、产品概览与发展历程
Qwen3.5 —— 阿里巴巴的多模态集大成之作
Qwen3.5 并非单一模型,而是三波次发布的完整家族。旗舰款 Qwen3.5-397B-A17B 于 2026 年 2 月 16 日上线,拥有 3970 亿总参数、170 亿激活参数,支持 256K 上下文和 201 种语言。与前一代 Qwen3 最大的不同在于:Qwen3.5 将视觉理解能力深度融合进基础模型,成为真正意义上的原生多模态模型,无需单独调用视觉适配器。
2 月 24 日发布中型系列(27B 密集版、35B-A3B、122B-A10B),3 月 2 日补全小型系列(0.8B 至 9B),均采用 Apache 2.0 协议开放权重。所有模型支持"思考"与"非思考"双模式,适配编码代理、对话、长文档分析等多类场景。值得关注的是,仅激活 3B 参数的 Qwen3.5-35B-A3B 已超越上一代 235B-A22B 的综合性能,验证了架构效率远胜参数堆砌。
GLM-5 —— 清华系的"国产芯片"宣言
GLM-5 由 Z.ai(原智谱 AI,清华大学孵化)于 2026 年 2 月 11 日正式发布。参数量约 744–745B,MoE 架构,每 token 激活约 40–44B 参数,上下文窗口 200K。尤为值得关注的是:GLM-5 全程使用华为昇腾芯片与 MindSpore 框架训练,完全摆脱对英伟达 GPU 的依赖,是迄今为止在硬件独立性上走得最远的顶级开源模型。
Z.ai 在 2026 年 1 月 8 日完成香港 IPO,募资约 43.5 亿港元(约 5.58 亿美元),成为全球首家上市的基础模型公司,市值约 313 亿美元。上市融资直接加速了模型迭代节奏:2 月 11 日 GLM-5、3 月 15 日 GLM-5 Turbo(闭源快推理版)、3 月 27 日 GLM-5.1 API 开放、4 月 7 日 GLM-5.1 开源权重——不到三个月完成四次发布。GLM-5 发布当日 Z.ai 股价最高涨幅达 34%。
DeepSeek-V4 —— "第二次 DeepSeek 时刻"
DeepSeek 于 2026 年 4 月 24 日发布 V4 系列:Pro(1.6 万亿参数,49B 激活)与 Flash(2840 亿参数,13B 激活)两款,均标配 1M token 上下文,MIT 许可。距离 V3 发布整整 484 天,研究员 Deli Chen 在发布时写道"AGI 属于所有人"。V4 的核心创新是 Hybrid Attention(CSA + HCA 混合稀疏注意力),在 1M token 场景下仅需 V3.2 单 token 推理 FLOPs 的 27%、KV Cache 的 10%,将超长上下文推理成本压至新低。同时引入 Muon 优化器替代 AdamW,在超 32T token 上完成预训练。
二、模型产品线全景对比
| 模型/系列 | 总参数 / 激活 | 上下文 | 架构 | 许可 | 发布日 |
|---|---|---|---|---|---|
| Qwen3.5-397B-A17B | 397B / 17B | 256K | 混合线性 MoE | Apache 2.0 | 2026-02-16 |
| Qwen3.5-Plus (API) | 397B / 17B(托管) | 1M | 同上(闭源服务) | API 专属 | 2026-02-16 |
| Qwen3.5 中型系列 | 27B / 35B-A3B / 122B | 256K | 密集 + MoE | Apache 2.0 | 2026-02-24 |
| GLM-5 | ~745B / 40-44B | 200K | MoE(昇腾芯片) | MIT | 2026-02-11 |
| GLM-5.1(升级版) | 744B / 40B | 200K / 131K 输出 | MoE, 强化学习升级 | MIT | 2026-04-07 |
| DeepSeek-V4-Pro | 1.6T / 49B | 1M | MoE(CSA+HCA 混合注意力) | MIT | 2026-04-24 |
| DeepSeek-V4-Flash | 284B / 13B | 1M | MoE(轻量版) | MIT | 2026-04-24 |
三、基准测试深度分析
以下数据来源于官方技术报告及第三方评测机构(SWE-bench、GPQA Diamond、AIME 2026、LiveCodeBench、Humanity's Last Exam 等)。旗舰模型以最强推理模式(Max/Pro-Max)作为代表数值。
从以上数据可以看出三款模型的各自优势方向:
- 编码能力:DeepSeek-V4-Pro-Max 以 93.5 的 LiveCodeBench 成绩和 3,206 的 Codeforces 评分居首,SWE-bench Verified 达 80.6%;GLM-5.1 在 SWE-Bench Pro 达 58.4,超越 Claude Opus 4.6(57.3)
- 数学/推理:GLM-5 在 HMMT Nov. 2025 拿下 96.9(所有测试模型最高之一),AIME 2026 三者基本持平(91.3–92.7 区间)
- 科学推理:DeepSeek-V4-Pro-Max 以 90.1% GPQA Diamond 略领,Qwen3.5(88.4)、GLM-5(86.0)紧随
- 多模态视觉:Qwen3.5 专项优势明显——MMMU 85.0(高于 Qwen3-VL 的 80.6)、MathVision 88.6(超越 GPT-5.2 的 83.0)
- 超难推理(HLE):DeepSeek-V4 无工具模式 37.7% 领先,GLM-5 带工具模式达 50.4% 超越多数闭源模型
四、定价策略全面解析
以下 API 定价数据来源于 OpenRouter 官方页面及各厂商官方文档(截至 2026 年 5 月)。
| 模型 | 输入 ($/M tokens) | 输出 ($/M tokens) | 上下文 | 许可 |
|---|---|---|---|---|
| Qwen3.5-Flash | $0.13 | $0.52 | 256K | Apache 2.0 |
| Qwen3.5-Plus (API) | $0.40 | $2.40 | 1M | 闭源服务 |
| GLM-5 | $0.60 | $1.92 | 200K | MIT |
| GLM-5.1(最新) | $1.05–$1.40* | $3.50–$4.40* | 200K | MIT |
| DeepSeek-V4-Flash | $0.14 | $0.28 | 1M | MIT |
| DeepSeek-V4-Pro | $1.74 | $3.48 | 1M | MIT |
*GLM-5.1 峰值时段(北京时间 14–18 时)按 3× 计费;来源:OpenRouter 及 Z.ai 官方(截至 2026 年 5 月)
💡 性价比亮点:DeepSeek-V4-Flash 以 $0.14/$0.28(输入/输出)提供接近 Pro 的能力,是目前性价比最高的选项,约为 Qwen3.5-Plus 输出价格的 1/8。Qwen3.5-Flash 在多模态场景下的性价比同样突出。GLM-5 定价居中,但提供最宽松的 MIT 许可和昇腾芯片自部署方案,无厂商锁定风险。
五、产品功能与生态系统
| 功能维度 | Qwen3.5 | GLM-5/5.1 | DeepSeek-V4 |
|---|---|---|---|
| 思维链/推理模式 | ✓ 双模式切换 | ✓ 推理模式 | ✓ 三档推理强度 |
| 原生多模态(视觉) | ✓ 图/视频/文档 | △ 独立 GLM-5V-Turbo | ✗ 暂未支持 |
| 最大上下文 | 1M(Plus API) | 200K | 1M(标配) |
| Agent 自主执行 | ✓ 工具使用增强 | ✓ >8 小时连续执行 | ✓ 编码 Agent 优先 |
| 文档直接生成 | △ 有限 | ✓ docx/xlsx/pdf | ✗ |
| 国产芯片训练 | △ | ✓ 华为昇腾全程 | ✗ |
| OpenAI 兼容 API | ✓ | ✓ | ✓ 同时兼容 Anthropic |
| 语言覆盖 | 201 种 | 中英为主 | 中英为主 |
| 词汇表大小 | 250K 词汇 | 未公开 | 未公开 |
六、架构创新深度解析
Qwen3.5 — 混合线性 MoE
采用 Gated DeltaNet + MoE 架构,将线性注意力机制与专家混合路由深度融合。35B-A3B 仅激活 3B 参数却超越上代 235B-A22B,每 token 成本极低。原生多模态通过早期融合(Early Fusion)训练实现,250K 词汇表配合多 token 预测可将 token 成本降低 10–60%。
GLM-5 — Slime 异步 RL
自研 Slime 异步强化学习基础设施,大幅提升 RL 训练吞吐量。全程基于华为昇腾芯片(MindSpore 框架)训练,完全独立于英伟达供应链。GLM-5.1 仅通过精细化 RL 与对齐(无需额外预训练)实现能力跃升,论证了后训练效率的极大潜力,可自主连续工作超过 8 小时。
DeepSeek-V4 — 双稀疏注意力
混合 CSA(压缩稀疏注意力)+ HCA(重度压缩注意力)架构,1M token 下仅需 V3.2 的 27% FLOPs、10% KV Cache,实现真正意义的百万上下文标配。引入 Muon 优化器替代 AdamW,FP4 量化感知训练覆盖专家权重,预训练超 32T tokens。
七、实际使用体验
✅ 各自核心优势
- 视觉能力领先,MathVision 88.6 超越 GPT-5.2(83.0)
- 201 种语言,国际化部署首选
- 小模型(9B)单 GPQA 81.7,超越多数 70B 模型
- Qwen Studio 生态:图像/视频/代码/文档一体
- Flash 版高性价比多模态处理
- SWE-Bench Pro #1(58.4),超越 Claude Opus 4.6
- Agent 连续自主工作 >8 小时,端到端文档生成
- 华为昇腾芯片全程训练,满足硬件合规要求
- MIT 许可,无商用限制,可完全自部署
- HMMT Nov. 2025 数学竞赛全场最高 96.9
- Codeforces 3206 最高竞赛编程评分
- LiveCodeBench 93.5 最强编码基准
- V4-Flash $0.14/M 输入,极致性价比
- 同时兼容 OpenAI + Anthropic API 格式
- 1M 上下文标配,CSA+HCA 高效推理
⚠️ 主要不足与注意事项
- 旗舰 397B 模型本地部署门槛极高
- AIME 2026 略低于竞品(91.3 vs 92.7)
- HLE 无工具约 30%,低于 DeepSeek-V4 的 37.7%
- 上下文仅 200K,不及另两家 1M
- 峰值时段 API 费用 3× 标准,成本不稳定
- 多模态视觉依赖独立 GLM-5V-Turbo
- 国际语言覆盖明显弱于 Qwen3.5
- 暂无原生多模态/视觉能力
- Pro 推理速度较慢(~32 tokens/s)
- NIST CAISI 独立评测指出综合能力滞后约 8 个月
- GPQA Diamond 90.1% 仍低于 GPT-5.5 的 93.6%
八、综合评分与选型建议
| 评分维度 | Qwen3.5 | GLM-5/5.1 | DeepSeek-V4 |
|---|---|---|---|
| 编码能力 | ⭐⭐⭐⭐ 8.0 | ⭐⭐⭐⭐ 9.0 | ⭐⭐⭐⭐⭐ 10.0 |
| 多模态能力 | ⭐⭐⭐⭐⭐ 9.5 | ⭐⭐⭐ 6.0 | ⭐ 3.0 |
| 推理/数学 | ⭐⭐⭐⭐ 8.0 | ⭐⭐⭐⭐ 9.0 | ⭐⭐⭐⭐ 8.5 |
| API 性价比 | ⭐⭐⭐⭐ 9.0 | ⭐⭐⭐ 7.0 | ⭐⭐⭐⭐⭐ 9.5 |
| Agent 能力 | ⭐⭐⭐⭐ 8.0 | ⭐⭐⭐⭐⭐ 9.5 | ⭐⭐⭐⭐ 8.5 |
| 生态/开放度 | ⭐⭐⭐⭐ 8.5 | ⭐⭐⭐⭐ 8.5 | ⭐⭐⭐⭐ 8.5 |
| 综合加权平均 | 8.5 / 10 | 8.2 / 10 | 8.3 / 10 |
🎯 选型建议速查
- 多模态 / 全球化产品:选 Qwen3.5-Plus,201 语言 + 图/视频理解,生态最成熟
- 小型本地部署(资源受限):选 Qwen3.5-9B,GPQA Diamond 81.7,性能远超同量级
- 长周期编码 Agent / 企业自部署:选 GLM-5.1,SWE-Bench Pro #1,MIT 许可,昇腾芯片自部署可选
- 高性能编程 / 竞赛级任务:选 DeepSeek-V4-Pro-Max,Codeforces 3206 无对手
- 极致性价比 API 调用:选 DeepSeek-V4-Flash,$0.14/M 输入,接近 Pro 的能力
九、总结
三款模型共同指向一个新时代:开源大模型已在多数基准上追平甚至局部超越闭源旗舰,且价格仅为后者的数分之一。Qwen3.5、GLM-5 和 DeepSeek-V4 代表了三条不同但同样有效的技术路径。
Qwen3.5 是"全能选手",多模态领域技术积累最深,国际化场景覆盖最广,小模型系列的性能突破让端侧部署成为现实。GLM-5/5.1 是"自主基础设施"拥趸的首选,从训练芯片到商用许可均实现了最高自由度,长 Agent 编码能力已达业界领先,并代表了中国 AI 产业在硬件独立性上的重要里程碑。DeepSeek-V4 则以架构革新再次证明"算法效率 > 参数堆砌",在编码和长上下文性价比上无人能及,成为全球开发者工具链的默认竞争者。
从更宏观的视角看,这场三方竞赛的本质是:如何在算力受限的条件下把大模型的边界推得更远。下一轮竞争将同时在架构效率、生态集成和硬件多元化三个维度展开。无论你的场景如何,三款模型都足以提供可信赖的旗舰级能力——价格已不再是阻碍。
本评测报告生成过程使用到 AI 技术