一、产品概览:从"氛围编程"到智能体工程
2026 年 2 月 11 日,智谱 AI(北京智谱华章科技股份有限公司,港交所代码:02513)正式发布并开源新一代旗舰基座模型 GLM-5。这是 GLM 系列自 2021 年以来最重要的版本迭代——直接跨越了 4.x 系列,以"5.0"的姿态宣告技术路线的重大升级。
值得关注的是,早在正式发布前数周,一个名为"Pony Alpha"的神秘模型已悄然出现在 OpenRouter 平台,凭借强大的长程任务处理能力迅速登上热度榜首,引发社区广泛猜测。直到 2 月 11 日,智谱官方才正式揭晓:Pony Alpha 正是 GLM-5 的匿名测试版本。这种"盲测"发布策略的最大意义在于——模型凭借纯粹的技术实力赢得了社区客观、不受品牌影响的评价。
二、GLM 系列发展历程
智谱的 GLM 系列走过了一条清晰的技术进化路线:
从 GLM-4 到 GLM-5 的演进,本质上是一条从"工具调用"到"自主执行"的跨越。GLM-4 开启了 Agent 产品化时代;GLM-4.5 通过 ARC(Agent、Reasoning、Coding)架构融合,从底层打通了智能体、推理与代码的深度整合;GLM-4.7 通过大规模强化学习扩展了编程与逻辑边界;而 GLM-5 则是这条路线的终极升级,主打"长程长时执行者",能够在复杂的真实软件工程场景中稳定交付。
三、技术架构深度解析
3.1 核心规格参数
| 参数 | GLM-5 数值 | 说明 |
|---|---|---|
| 总参数量 | 744B | MoE 架构,对比 GLM-4.7 的 355B |
| 激活参数量 | 40B | 推理时实际激活 |
| 预训练数据量 | 28.5T tokens | 较上代 23T 增加约 24% |
| 上下文窗口 | 202K tokens | 最大输出 128K |
| 注意力机制 | MLA + DSA | 引入 DeepSeek 稀疏注意力(DSA) |
| 训练框架 | Slime 异步 RL | 自研异步强化学习基础设施 |
| 量化版本 | BF16 / FP8 / INT4 | FP8 版本需 8×H200 或同等配置 |
| 芯片兼容性 | 全栈国产适配 | 华为昇腾、摩尔线程、寒武纪、昆仑芯等 |
3.2 两大核心技术创新
① 动态稀疏注意力(DSA):传统 Transformer 的密集注意力计算复杂度随上下文长度呈 O(N²) 增长,对于 200K 的长上下文来说计算成本极其昂贵。GLM-5 引入了与 DeepSeek V3.2 同款的动态稀疏注意力机制(DSA),通过动态选择重要 Token,在保持长文本处理效果的同时大幅降低计算成本。
② 异步强化学习基础设施(Slime):标准 PPO 算法存在 GPU 利用率长期徘徊在 20%-30% 的问题。智谱基于自研的 Slime 框架,为 GLM-5 重写了一套完全异步的 RL 训练设施:推理引擎与训练引擎解耦到不同 GPU 设备上,持续生成轨迹并批量更新模型,GPU 利用率和训练效率得到显著提升。
四、基准测试:开源第一的实力
在核心编程基准 SWE-bench Verified 上,GLM-5 取得了开源模型最高分 77.8 分,超越 Gemini 3.0 Pro,与 Claude Opus 4.5 基本持平;在 Terminal Bench 2.0 上得分 56.2,同样为开源第一。
在 Artificial Analysis Intelligence Index v4.0 中,GLM-5 首次突破开源模型 50 分大关(此前 GLM-4.7 为 42 分),成为当时开源权重模型的综合能力领跑者。
五、核心功能与产品生态
GLM-5 不仅是基础模型,还配套了完整的产品生态:
- 智谱清言(Z.ai / chat.z.ai):面向 C 端的对话产品,已上线 GLM-5 及 GLM-5.1
- 智谱开放平台(bigmodel.cn):面向开发者的 API 服务平台,提供按量计费和订阅套餐
- GLM Coding Plan:专为 AI 编码场景设计的订阅套餐,适配 Cursor、Cline、Claude Code 等主流编程工具
- AutoGLM / GLM-PC:基于 GLM 驱动的 Agent 产品,支持自主执行超过 50 步操作
- CodeGeeX:智谱旗下的智能编程助手,基于 GLM 系列模型
六、定价策略全面解析
6.1 API 按量计费(截至 2026 年 5 月)
| 模型 | 输入价格(/1M tokens) | 输出价格(/1M tokens) | 备注 |
|---|---|---|---|
| GLM-5(国内) | ¥4(≤32K)/ ¥6(>32K) | ¥18 / ¥22 | 按上下文长度分段计费 |
| GLM-5(国际) | $1.00 | $3.20 | 海外 Z-ai 平台 |
| GLM-5.1(国际) | $1.05 | $3.50 | 2026 年 4 月 7 日发布 |
| GLM-4.5(国际) | $0.60 | $2.20 | GLM-5 旗舰前代 |
6.2 GLM Coding Plan 订阅套餐
GLM Coding Plan 是智谱为 AI 编码场景打造的专项订阅服务,支持 GLM-5.1、GLM-5-Turbo、GLM-4.7 等模型,适配 Cursor、Cline 等主流工具。
| 套餐 | 国内价格 | 国际价格(2026 年 4 月起) | 额度限制 |
|---|---|---|---|
| Lite | ¥132/季度 | 已停止新购 | 2026 年 3 月起暂停新购 |
| Pro | ¥200/月(¥402/季度) | $18/月 | 9 万次请求/月,每 5 小时 6000 次 |
注:套餐额度折算为 API 等价调用,约为月费的 15-30 倍。GLM-5 在峰值时段(14:00-18:00 UTC+8)消耗 3× 额度,非峰值消耗 2×。
七、综合能力雷达图
八、实际使用体验
✅ 优势亮点
- Agentic 工程能力突出:能够在模糊复杂目标下,完成从理解、规划到执行与自检的全流程智能体任务,真正实现"一句话输入到完整交付物"。
- 前后端兼顾:不同于以往偏重前端美化的模型,GLM-5 在后端重构、系统工程、深度调试方面表现同样出色。
- 长程稳定性高:在 200K 超长上下文下,目标一致性与多步骤依赖关系处理能力明显优于前代。
- 开源且全栈国产芯片适配:支持华为昇腾等七大国产芯片,在国产化替代场景有独特优势。
- 性价比卓越:API 价格约为 Claude Opus 4.5 的 1/23,性价比极高。
⚠️ 不足与局限
- 部署门槛较高:FP8 版本需要至少 8 块 H200,不适合个人或小团队自部署。
- 综合能力仍有差距:在语言创作、知识深度等通用能力上与 Claude Opus 4.5 仍存在一定差距。
- 多模态能力相对薄弱:GLM-5 主力定位在文本与代码,多模态能力较单独的视觉模型稍逊。
- 价格调整频繁:2026 年以来多次涨价,国际版订阅价格上涨 30%-60%,需关注后续变动。
九、竞品横向对比
| 维度 | GLM-5 | Claude Opus 4.5 | DeepSeek V3.2 | Qwen3 Max |
|---|---|---|---|---|
| 开源 | ✅ MIT | ❌ | ✅ | ✅ |
| SWE-bench Verified | 77.8 | ~78 | ~70 | 截至评测时未获取到官方数据 |
| 上下文窗口 | 202K | 200K | 128K | 1M(Max) |
| 输出价格($/1M) | $3.20 | $75.00 | $1.10 | ~$1.50 |
| Agent 基准 | 开源第一 | 闭源领先 | 优秀 | 优秀 |
| 国产芯片适配 | ✅ 全栈 | ❌ | 部分 | 部分 |
十、总结评分与使用推荐
GLM-5 是 2026 年目前开源模型中综合表现最为突出的旗舰模型之一,尤其在编程和 Agent 场景下已经实现了对标顶尖闭源模型的水准,价格却仅为竞争对手的一小部分。
| 评测维度 | 评分(满分 5 分) | 简评 |
|---|---|---|
| 编程能力 | ⭐⭐⭐⭐⭐ 5.0 | 开源 SOTA,逼近 Claude Opus |
| Agent 能力 | ⭐⭐⭐⭐⭐ 4.8 | 多项基准开源第一 |
| 性价比 | ⭐⭐⭐⭐⭐ 5.0 | 相比闭源竞品价格低 20x 以上 |
| 通用对话能力 | ⭐⭐⭐⭐ 3.8 | 专注编程,通用场景稍弱 |
| 部署便捷性 | ⭐⭐⭐ 3.2 | 硬件门槛较高 |
| 综合评分 | ⭐⭐⭐⭐⭐ 4.5 | 开源编程/Agent 首选 |
推荐使用场景
- 需要 AI 驱动的大型软件工程项目(后端重构、系统调试)
- 构建 Agent 应用、多步骤任务自动化流水线
- 对成本敏感、需要高性价比编程辅助的开发团队
- 希望接入国产芯片私有化部署的企业用户
- 使用 Cursor / Claude Code 等工具进行 AI 辅助开发
本评测报告生成过程使用到 AI 技术