增长案例库 Maxed 归档 AI搜索优化综合

GLM-5.2:悄悄追上 GPT-5.5 的开源权重模型

GLM-5.2: The Open-Weight Model That Quietly Caught Up to GPT-5.5

中文译文 · 7k 字

一句话摘要

介绍开源权重模型 GLM-5.2 在性能上逼近 GPT-5.5。

GLM-5.2:悄悄追上 GPT-5.5 的开源权重模型 2026 年 7 月 15 日 · 阅读 6 分钟 · 查看源码 ↗ AI Claude Hardware Marketing 2026 年的大多数 AI 发布都遵循同一个剧本:一个美国实验室的闭源模型、一个高昂的价格标签,以及一张你无法自己复现的基准表。你读完公告、点点头,然后回去继续付同样的 API 账单。 GLM-5.2 打破了那个剧本。 2026 年 6 月 16 日,总部位于北京的 Z.ai(前身为智谱 AI,2019 年从清华大学分拆出来的公司)发布了一个 7530 亿参数的模型,采用纯 MIT 许可证,拥有 100 万 token 的上下文窗口——比其前代 20 万的上限大了五倍。编码性能紧逼 GPT-5.5 和 Claude Opus 4.8,成本却只是一小部分。而且因为权重是真正公开的,没有人需要为其中任何一项轻信 Z.ai 的说法。 开发者的反应是即时的。发布后几小时内,Kilo Code 背后的团队就在 X 上发帖称 GLM-5.2 已经在他们的工具里运行了——第一天,无需等待期。这已经成为判断一个开源权重发布是否重要的真正信号:不是公告本身,而是现有代理生态在没有被要求的情况下,多快就采纳了它。 你可以亲自验证的数字 这不是一张营销表格——权重在 Hugging Face 和 ModelScope 上,所以你可以用自己的硬件跑基准测试,验证这些说法是否站得住脚。 在 Terminal-Bench 2.1 上,GLM-5.2 得分 81.0——从 GLM-5.1 的 62.0 大幅跃升,只落后 Claude Opus 4.8 的 85.0 几分,同时直接击败 Gemini 3.1 Pro。在 SWE-bench Pro 上——它衡量的是从真实仓库中拉取的真实 bug 修复,而不是合成问题——它是 62.1,对 GPT-5.5 的 58.6。在 FrontierSWE 上它得分 74.4,再次领先 GPT-5.5 的 70.0。 这也不只是一个编码的故事。2026 年 6 月 19 日,Design Arena 把 GLM-5.2 放到其单轮 HTML 网页设计排行榜的第一名,Elo 分数约 1360——击败了 Claude Fable 5 以及 Opus 4.6 和 4.7 两代,并且相对它自己的前代跳升了五名。它还在 Code Arena Frontend 上排名第二,并在 Artificial Analysis Intelligence Index v4.1 上位居开源权重类别榜首。 诚实的保留:在 SWE-Marathon 上——一个覆盖构建编译器、优化内核、从零交付生产级服务这类极端难度任务的基准——GLM-5.2 仍落后 Opus 4.8 约 13%。在所有三个长时程基准上,它都以明显优势是最佳开源权重模型,但它是 2026 年最强的开源权重模型,而不是一个绝对的新王者。 为什么这改变了成本数学 Z.ai 通过自己的 API 给 GLM-5.2 定价为每百万输入 token $1.40、每百万输出 token $4.40——大约是 GPT-5.5 在可比编码工作上混合成本的六分之一。对于运行高容量代理工作流的团队来说,这个差距复利得很快:一个在闭源前沿 API 上每月 $900 的工作负载,在 GLM-5.2 上可以降到接近 $150,还不算任何自托管折扣。 而这还没算那个更大的优势:MIT 许可证意味着你可以下载权重,在自己的硬件上自托管、微调它们,或逐行检查。到那时,你的每 token 成本就是你的电费账单,而不是一张 API 发票。Z.ai 在自己的文档里直说:「无地域限制」,「无国界的技术访问」——无需申请使用权限、无地理限制、无供应商锁定、也没有一份「可接受使用」政策横在你和生产之间。 关于市场有多认真对待这件事:Z.ai 于 2026 年 1 月 8 日在香港证券交易所上市(代码 2513.HK),募资约 43 亿港元——约 $5.58 亿美元——它称之为全球首例大型语言模型公司 IPO。这不是一个副业;这是一家把上市押注在「开源权重是制胜策略」上的公司。 引擎盖下面是什么 架构上,它是一个 Mixture-of-Experts(专家混合)模型:总共 7530 亿参数,但每个 token 只激活约 400 亿——这正是为什么即使在这个规模下推理仍保持相当快,也是为什么自托管它不需要你从标题里那个参数量去推想的那类硬件。 关键的工程部分是 IndexShare:一个轻量级的索引器,在每四个稀疏注意力(DSA)层之间复用,在完整的 100 万 token 上下文下把每 token 计算量削减了 2.9 倍。还有一个改进的 MTP(multi-token prediction,多 token 预测)层用于推测解码,把被接受的 token 长度最多提升 20%——在模型每个任务生成数千 token 的长代理运行中,这是一个有意义的速度增益。 GLM-5.2 还附带了两个可选的推理模式,High 和 Max,让你在延迟和能力之间做取舍,取决于你是在做快速编辑,还是一个真正困难的、多步骤的任务。Z.ai 特别推荐把 Max 用于复杂的编码工作。 通过一个 Anthropic 兼容端点,第一天支持就直通 Claude Code、Cline 以及其他 20 多个代理环境,该模型还通过六个第三方推理服务商提供,包括 DeepInfra、Fireworks 和 FriendliAI。无需等待单独的集成——它发布当天就插进了你已经在用的工具里。 何时用 GLM-5.2,何时留在 Claude 独立测试的实际结论是,这不是一个「替代」的故事,而是一个「路由」的故事。安全公司 Semgrep 在 IDOR 漏洞检测上把 GLM-5.2 与 Claude Code 对比,发现它的 F1 得分为 39%,对 Claude 的 32%,每发现一个漏洞的成本大约 $0.17——尽管两者都仍落后于 Semgrep 自己专为任务打造的多模态流水线的 53-61% F1。这是一个有用的数据点,恰恰因为它是混合的:GLM-5.2 在这个特定任务上赢了,在同一任务上输给一个专门工具,而「最佳」答案完全取决于你在优化什么。 发给 GLM-5.2:日常 bug 修复、基于模板的重构、前端和 HTML 工作(它在这里是名副其实的排行榜头名选择)、测试和 lint,以及那些 100 万 token 上下文比多挤几分精度更重要的长代理运行。 留在 Claude Opus 4.8:最难的仓库级修复、漏掉一个漏洞代价高昂的安全敏感代码、需要在长构建中持续保持正确性的 SWE-Marathon 级问题,以及任何错误成本高到 token 节省不再重要的场景。 诚实的结论 GLM-5.2 是 2026 年第一个真正缩小与前沿性能差距、而不是只在营销幻灯片上接近它的开源权重模型。对于日常编码,它已经是一个经济上合理的、昂贵闭源 API 的替代品——而你能在自己的硬件上亲自验证每一项声明这个事实,是任何基准表都无法提供的一种不同信任。对于最难的问题,前沿模型仍握有优势,而在赌注真正高的时候升级到它们,依然是一种聪明的策略,而不是认输。 如果这对你有用,关注 @BLAZT_AI,我每天都发类似这样的东西——没有废话,只有真正值得用的。标签:# X # AI # Claude # Hardware # Marketing # Growth # Chatgpt # Fable 相关文章 OpenClaw: The Personal AI Agent That Went Viral in January and Nobody Explained How to Set It Up OpenClaw: The Personal AI Agent That Went Viral in January and Nobody Explained How to Set It Up AI Marketing Claude Hardware

原文参考:https://maxed.wiki/posts/glm-5-2-the-open-weight-model-that-quietly-caught-up-to-gpt-5-5/ (Maxed.wiki,本页为站内中文整理)