# GLM-5.3 发布:基座没变,编程涨 50%,安全能力却意外爆发
前面写 GLM-5.2 时,我说它的发布方式很反常:先让 Coding Plan 用户用,跑分和权重后补。
两个月后,GLM-5.3 来了。
这次正好反过来。
大表、公开 benchmark、私有 Code Bench、Token 消耗、安全评测,一次全摊开。
但最值得聊的,不是又多了一个版本号。
GLM-5.3 和 GLM-5.2 用的是同一个基座,所有提升都来自后训练。
下面不是我整理的海报,是 2026 年 8 月 14 日 智谱官方发布页 (opens new window) 的首屏截图。

官方把第一句话加了粗:Scaling post-training is all we did for GLM-5.3.
翻成人话:这次没有换更大的基座,而是把同一个模型放进更多、更长、更接近真实工作的环境里继续练。
这件事比“参数又涨了多少”更值得开发者看。
# 一、先把发布信息说清楚
截至 2026 年 8 月 20 日,GLM-5.3 的状态是:
- API 和 GLM Coding Plan 已经能用
- 只支持文本输入
- 上下文窗口 100 万 Token
- 最大输出 12.8 万 Token
low、high、max三档思考强度,默认max- 不再支持关闭思考
- 权重还没放出,官方承诺发布两周后开放
最后一条最容易被标题带偏。
官方称它是“最强开源权重编程模型”,但同一页也写了 Hugging Face Coming Soon。
所以现在准确的说法是:模型已经发布,API 已上线,权重计划在 8 月 28 日前后开放。
在权重真正下载到手、许可证也落地之前,先别把“即将开源”写成“已经开源”。
# 二、基座没变,编程为什么还能涨 50%
官方给出的答案,是把后训练环境继续往真实工作推。
过去很多 Coding benchmark,像一道道独立考题。
GLM-5.3 的训练任务更像真实工程:拿到代码仓、内部文档、计算集群、实验结果,自己找瓶颈、改代码、跑实验,再证明端到端真的变快。
有些环境,对熟练工程师来说也要做几天。
难点也随之从“模型会不会写代码”,变成了“训练环境能不能执行、能不能验证、奖励会不会被钻空子”。
智谱的做法是让研究 Agent 生成长程任务,再让 judge Agent 先跑一遍,检查任务是不是真的有解;验证器还要通过 oracle、no-op 和未完成状态检查,才能产出训练用的二元奖励。
模型不是多背了几道题,而是多进了很多可运行、可验收的工程现场。
这背后沿用了 GLM-5.2 的 SAO、长程上下文压缩和 slime 异步强化学习框架。
官方称系统侧优化让长程 Coding RL 的端到端训练吞吐提高了 2.3 倍以上。
环境更多、轨迹更长、训练跑得动,才有了这次小版本的大跳跃。
# 三、跑分确实涨了,但别只看蓝柱子
先看官方公开图。

几个提升很直观:
| 评测 | GLM-5.2 | GLM-5.3 | 变化 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | 约 6.2 倍 |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 |
| Agents' Last Exam | 23.8 | 28.5 | +4.7 |
| AutomationBench | 26.2 | 48.2 | +22.0 |
“编程提升 50%”来自智谱自建的 Z.ai Code Bench,不是第三方公开榜。
它的好处是更贴近真实本地开发环境,也更难被公开训练集污染。
它的限制也很明显:题目、评分细节和复现环境不完全公开。
所以 50% 可以证明同一套内部尺子下进步很大,不能直接翻译成“你手里的项目效率必涨 50%”。
更有意思的是 Token 效率。

在 Z.ai Code Bench 上:
- GLM-5.3
max:34.5%,每题约 7.5 万输出 Token - GLM-5.2
max:23.4%,每题约 9.6 万输出 Token - GLM-5.3
high:31.4%,每题约 5 万输出 Token - Claude Opus 4.8
high:29.5%,每题约 12 万输出 Token - Claude Fable 5
max:39.5%,仍然最高
这个结果比“多赢两个点”更实用。
Agent 写代码不是只付答案的钱,失败重试、无效思考和超长轨迹都要付钱。
如果同一类任务做得更准、输出还更短,真实账单和等待时间都会一起下降。
当然,这仍然是官方私有 benchmark。
拿自己的仓库做 A/B 测试,永远比转发柱状图靠谱。
# 四、真正意外的,是安全能力长得太快
这次发布标题里没有只写 Coding,还写了 Emergent Cyber Capabilities。
智谱原本把漏洞发现数据和环境加入后训练,是想让模型更会找漏洞。
结果继续 Scaling 后,模型不只会指出单点问题,还开始串联漏洞分析、验证和完整利用链。

三项数据要分开看:
- CyberGym:84.5%,高于 GLM-5.2 的 77.2%,也略高于 Fable 5 和 GPT-5.6 Sol
- ExploitBench:54.4%,是 GLM-5.2 的 24.4% 的两倍多
- ExploitGym:两小时完成 105 项、六小时 130 项;GLM-5.2 分别是 29 和 39 项
但越接近真实利用,闭源前沿模型的领先也越明显。
ExploitBench 上 Fable 5 是 78.0%,GPT-5.6 Sol 是 76.5%;ExploitGym 六小时,Fable 5 完成 247 项。
GLM-5.3 的结论不是“安全能力全面第一”,而是它在原本差距最大的利用链上,增长速度最快。
智谱还称,从 GLM-5.2 开始与国内安全团队合作,经过专家复核、筛选和去重,模型在 269 个项目里发现了 2436 个漏洞,其中 1097 个为严重或高危问题。
这些数字已经被放进 Z.ai Security Disclosure Ledger (opens new window) 持续披露。
这也是一个必须正视的边界。
漏洞发现可以帮维护者提前修复,也可能降低攻击门槛。
官方因此把权重开放往后放两周,先做安全评估和加固。
这个等待不是“开源跳票”的小事,是能力真的跨过了一条风险线。
# 五、价格没涨,但 API 迁移有一个坑
按照 Z.ai 官方价格页 (opens new window),GLM-5.3 和 GLM-5.2 单价相同:
| 每百万 Token | GLM-5.3 |
|---|---|
| 输入 | 1.4 美元 |
| 缓存输入 | 0.26 美元 |
| 输出 | 4.4 美元 |
价格没变,能力更强、平均输出更少,这才是 5.3 最直接的性价比提升。
Coding Plan 已经全量切到 5.3,并改成积分额度;工作日 14:00—18:00 是高峰,其他时间和周末按 50% 积分消耗。
但准备把 API 从 5.2 改到 5.3 的录友,别只换模型 ID。

GLM-5.3 强制开启思考。
如果旧代码还在传:
{"thinking": {"type": "disabled"}}
要先改成:
{
"model": "glm-5.3",
"thinking": {"type": "enabled"},
"reasoning_effort": "low"
}
2
3
4
5
再切模型 ID,否则请求会直接失败。
复杂编程任务官方推荐 max;想控制延迟和成本,就从 low 或 high 开始测。
这三个档位不是越高越好。
一个能自动验收的批量任务,用 low 跑两次,可能比 max 跑一次更划算。
# 六、和 Kimi K3、DeepSeek V4、Claude 怎么选
别站队,算三笔账:失败成本、数据边界、任务规模。
| 你的任务 | 更适合谁 | 原因 |
|---|---|---|
| 复杂 Coding Agent,想兼顾能力与 Token 成本 | GLM-5.3 | 长程能力涨幅大,官方私榜 Token 效率不错,API 价格不变 |
| 前端视觉、交互和原生多模态 | Kimi K3 | K3 的视觉理解和前端审美更突出,GLM-5.3 当前只支持文本 |
| 高失败成本的最难工程任务 | Claude Fable 5 / GPT-5.6 Sol | 多项前沿评测仍更强,失败一次的代价高时先买成功率 |
| 批量任务、价格敏感、结果可自动验证 | DeepSeek V4 | 重点算吞吐和总成本,不必每一步都上最贵模型 |
| 代码不能外传、必须私有化 | 等 GLM-5.3 权重开放后实测 | 截至本文写作时权重尚未发布,别拿未来承诺替代当前交付 |
如果你已经在用 GLM Coding Plan,直接拿正在做的仓库试 5.3。
重点看四个指标:一次成功率、总输出 Token、完成时间、人工接管次数。
如果你等的是私有化部署,先别急。
等权重、许可证、推理框架支持和第三方量化一起落地,再算显存和吞吐账。
# 写在最后
GLM-5.3 最值得记住的,不是“又一个国产模型刷新跑分”。
而是它证明了:基座不变,靠真实环境、可验证奖励和更长的后训练,仍然能把 Agent 能力往上推一大截。
但安全能力的意外爆发,也提醒所有人:模型越会完成真实工作,能力和风险就越难拆开。
先拿真实任务测。
别拿发布会的蓝柱子替你做决定。
资料核对:
- 官方发布页:https://z.ai/blog/glm-5.3
- 模型文档:https://docs.z.ai/guides/llm/glm-5.3
- API 价格:https://docs.z.ai/guides/overview/pricing
- 安全披露台账:https://cvd.z.ai/
评论
验证登录状态...