GLM-5.2:第一个在编程基准上击败 GPT-5 的开源模型
智谱发布 GLM-5.2,753B 参数、MIT 许可证、百万上下文,在 SWE-bench Pro 等多个编程基准上超越 GPT-5.5,API 成本仅为闭源模型的六分之一。这标志着开源模型首次真正打入编程能力的第一梯队。
2026 年 6 月 17 日,智谱(现已更名 Z.ai)发布了 GLM-5.2。这不是一次普通的版本迭代——它是历史上第一个在编程基准上击败 GPT-5 的开源权重模型。
一句话总结
753B 参数、MIT 许可证、100 万 token 上下文,专为长时间编程 Agent 任务优化。在 SWE-bench Pro、FrontierSWE、MCP-Atlas 三个核心 Agent 编程基准上全面超越 GPT-5.5,仅次于 Claude Opus 4.8,而 API 调用成本仅为后者的约六分之一。
基准测试:真枪实弹的数据
以下是智谱官方公布的核心基准对比(数值越高越好):
| 基准 | GLM-5.2 | GPT-5.5 | Opus 4.8 |
|---|---|---|---|
| SWE-bench Pro | 62.1 | 58.6 | 69.2 |
| FrontierSWE | 74.4 | 72.6 | 75.1 |
| MCP-Atlas(工具使用) | 76.8 | 75.3 | 77.8 |
| Terminal-Bench 2.1 | 81.0 | 84.0 | 85.0 |
| SWE-Marathon(长时任务) | 13.0 | 12.0 | 26.0 |
数据呈现出清晰的画面:在 Agent 编程的「甜点区」——正常的 feature 开发和 bug 修复——GLM-5.2 稳超 GPT-5.5,紧追 Opus 4.8。但在最残酷的 SWE-Marathon(多步骤、数小时的超长重构任务)上,Opus 4.8 仍然以近乎一倍的差距稳居榜首。这说明:如果你的工作负载是正常的 Agent 循环,GLM-5.2 完全够用;如果是持续整天的重度重构,闭源前沿模型仍然值回票价。
值得一提的是,这些数据来自智谱自己的测试报告,建议在自己的代码库上独立验证。
技术设计:不是为了聊天,是为了持续工作
GLM-5.2 的架构选择透露了一个清晰的信号:它不是为了回答一个漂亮的一次性问题,而是为了支撑一个 Agent 在长达数小时的编码会话中保持连贯。
IndexShare 注意力机制:智谱引入了一种新的注意力方案,在满 100 万 token 上下文下,将每 token 的计算量降低约 2.9 倍。配合投机解码的吞吐量改进,这意味着一个 Agent 可以在一个会话中反复读代码库、编辑多个文件、运行终端命令,而不至于越跑越慢。
MIT 许可证:这是整个故事里最关键的一行字。不是"开放权重仅供研究",不是"商用需授权",而是简单粗暴的 MIT。这在 753B 级别的模型中极为罕见,意味着任何人都可以下载、修改、商用、再分发,没有任何附加条件。
ZCode:官方 Agent 工具免费了
7 月 2 日,智谱将官方 Agent 编程工具 ZCode 设为免费下载(版本 3.2.2,支持 macOS / Windows / Linux)。ZCode 是一个 Agent-first 的开发环境:你描述目标,Agent 读取代码库、规划方案、编辑文件、执行终端命令、迭代修正。它支持接入任何兼容 OpenAI 或 Anthropic 协议的 API,所以你可以用 Claude、DeepSeek 或任何你喜欢的模型来驱动它。
免费版附带 5 天的完整 GLM-5.2 试用,付费方案从 $16.20/月(Light)到 $144/月(Max)。对于想低成本体验前沿编程 Agent 的开发者来说,现在的门槛已经降到了零。
API 成本:六分之一,不是噱头
| 模型 | 输入(百万 token) | 输出(百万 token) |
|---|---|---|
| GLM-5.2 | ~$1.40 | ~$4.40 |
| GPT-5.5 | ~$5.00 | ~$30.00 |
| Opus 4.8 | ~$5.00 | ~$25.00 |
Agent 编程是典型的 token 重度场景——一个小时的 Agent 会话可能消耗数百万 token。在这个量级下,成本差异不是「便宜一点」,而是决定性的架构选择。用一个能跑出 90% 水平、收六分之一价格的模型,对大多数团队来说不是妥协,是策略。
现实中的坑:数据驻留问题
基准图表不会告诉你的一件事:Z.ai 的生产 API 部署在中国境内,这意味着每一次通过官方 API 的调用都受到中国法律的管辖,包括国家安全条款中可能要求服务商配合政府请求的规定。
对于个人项目或非敏感的商业开发,这不是问题。但对于金融、医疗、法律、政府等受监管行业,这个数据驻留风险可能直接让托管 API 方案出局。
这正是开源权重值钱的地方。 因为 GLM-5.2 是 MIT 许可证,有严格数据合规要求的团队可以下载权重,在自己的基础设施上部署,代码永远不会离开公司网络。这是任何闭源 API 模型无论多便宜都无法提供的绝对优势。
代价是:你自己得喂得动一个 753B 参数的模型。这不是笔记本项目。
轻量版:GLM-5.2 Air
如果你的硬件不够跑完整的 753B,智谱还发布了一个 Air 版本:106B 总参数、12B 激活的 MoE 架构,4-bit 量化后约需 60GB 显存,刚好能在 64GB 的 Mac 上运行。它的 SWE-bench Pro 得分是 58%,虽然不如旗舰版,但已经超越了 GPT-5.5 的同项成绩。对于一个能在个人电脑上本地运行的模型来说,这个数字在一年前是不可想象的。
开源编程模型的格局变了
GLM-5.2 的发布,加上同月发布的 Qwen 4.1(32B-A3B,80% SWE-Verified,24GB Mac 可跑)、DeepSeek R3(AIME 95%)、Llama 5 405B 等,共同构成了 2026 年 7 月开源大模型的井喷格局。开源模型在编程能力上不再是「追赶者」的角色——它们已经开始在关键基准上正面挑战甚至超越闭源模型。
对开发者来说,这是一个罕见的时刻:顶级编程能力不再是 API 月费的竞拍战,而是可以下载到本地、按自己的节奏使用的工具。MIT 许可证让这件事从「技术突破」变成了「产业基础设施」。