卡码笔记-最强八股文
首页
计算机基础
C++
Java
Go
🔥大模型🔥
  • 大模型面经
  • Java面经
  • C++面经
简历专栏
秋招投递表
代码随想录 (opens new window)
首页
计算机基础
C++
Java
Go
🔥大模型🔥
  • 大模型面经
  • Java面经
  • C++面经
简历专栏
秋招投递表
代码随想录 (opens new window)
  • 本栏必读

    • 卡码大模型专栏介绍
  • 大模型面经

  • 大模型动态

    • GLM-5.3发布
    • DeepSeek Harness安装与使用
    • DeepSeek V4全系列正式版上线
    • Claude给文字打隐形水印
    • DeepSeek V4-Flash正式版上线
    • 长鑫科技上市与DRAM壁垒
    • GPT-5.6后不用Superpowers了
    • Claude Opus 5发布
    • Kimi K3发布
    • GPT-5.6发布
    • Claude Code为什么针对中国IP封号
    • DeepSeek招Agent Harness
    • Codex Record & Replay
    • Kimi K2.7-Code发布
    • GLM-5.2发布
    • MiniMax M3评测
    • DeepSeek V4发布
    • GPT-5.5发布
    • Claude Opus 4.7发布
    • Claude Opus 4.8发布
    • Claude Fable 5发布
    • Claude Fable 5重新开放
    • DeepSeek V4降价75%实测
    • DeepSeek V4-Pro永久降价75%
  • Claude学习专栏

  • 入门认知

  • Prompt与调用基础

  • RAG检索增强

  • Agent智能体

  • 微调认知

  • 部署与工程化

  • 多模态入门

  • Transformer原理

  • 手撕Transformer

  • 模型家族与Llama架构

# GLM-5.3 发布:基座没变,编程涨 50%,安全能力却意外爆发

前面写 GLM-5.2 时,我说它的发布方式很反常:先让 Coding Plan 用户用,跑分和权重后补。

两个月后,GLM-5.3 来了。

这次正好反过来。

大表、公开 benchmark、私有 Code Bench、Token 消耗、安全评测,一次全摊开。

但最值得聊的,不是又多了一个版本号。

GLM-5.3 和 GLM-5.2 用的是同一个基座,所有提升都来自后训练。

下面不是我整理的海报,是 2026 年 8 月 14 日 智谱官方发布页 (opens new window) 的首屏截图。

GLM-5.3官方发布页

官方把第一句话加了粗:Scaling post-training is all we did for GLM-5.3.

翻成人话:这次没有换更大的基座,而是把同一个模型放进更多、更长、更接近真实工作的环境里继续练。

这件事比“参数又涨了多少”更值得开发者看。

# 一、先把发布信息说清楚

截至 2026 年 8 月 20 日,GLM-5.3 的状态是:

  • API 和 GLM Coding Plan 已经能用
  • 只支持文本输入
  • 上下文窗口 100 万 Token
  • 最大输出 12.8 万 Token
  • low、high、max 三档思考强度,默认 max
  • 不再支持关闭思考
  • 权重还没放出,官方承诺发布两周后开放

最后一条最容易被标题带偏。

官方称它是“最强开源权重编程模型”,但同一页也写了 Hugging Face Coming Soon。

所以现在准确的说法是:模型已经发布,API 已上线,权重计划在 8 月 28 日前后开放。

在权重真正下载到手、许可证也落地之前,先别把“即将开源”写成“已经开源”。

# 二、基座没变,编程为什么还能涨 50%

官方给出的答案,是把后训练环境继续往真实工作推。

过去很多 Coding benchmark,像一道道独立考题。

GLM-5.3 的训练任务更像真实工程:拿到代码仓、内部文档、计算集群、实验结果,自己找瓶颈、改代码、跑实验,再证明端到端真的变快。

有些环境,对熟练工程师来说也要做几天。

难点也随之从“模型会不会写代码”,变成了“训练环境能不能执行、能不能验证、奖励会不会被钻空子”。

智谱的做法是让研究 Agent 生成长程任务,再让 judge Agent 先跑一遍,检查任务是不是真的有解;验证器还要通过 oracle、no-op 和未完成状态检查,才能产出训练用的二元奖励。

模型不是多背了几道题,而是多进了很多可运行、可验收的工程现场。

这背后沿用了 GLM-5.2 的 SAO、长程上下文压缩和 slime 异步强化学习框架。

官方称系统侧优化让长程 Coding RL 的端到端训练吞吐提高了 2.3 倍以上。

环境更多、轨迹更长、训练跑得动,才有了这次小版本的大跳跃。

# 三、跑分确实涨了,但别只看蓝柱子

先看官方公开图。

GLM-5.3公开跑分对比

几个提升很直观:

评测 GLM-5.2 GLM-5.3 变化
Terminal-Bench 3.0 4.6 28.3 约 6.2 倍
DeepSWE v1.1 46.2 66.9 +20.7
Agents' Last Exam 23.8 28.5 +4.7
AutomationBench 26.2 48.2 +22.0

“编程提升 50%”来自智谱自建的 Z.ai Code Bench,不是第三方公开榜。

它的好处是更贴近真实本地开发环境,也更难被公开训练集污染。

它的限制也很明显:题目、评分细节和复现环境不完全公开。

所以 50% 可以证明同一套内部尺子下进步很大,不能直接翻译成“你手里的项目效率必涨 50%”。

更有意思的是 Token 效率。

Agent编程效果与Token关系

在 Z.ai Code Bench 上:

  • GLM-5.3 max:34.5%,每题约 7.5 万输出 Token
  • GLM-5.2 max:23.4%,每题约 9.6 万输出 Token
  • GLM-5.3 high:31.4%,每题约 5 万输出 Token
  • Claude Opus 4.8 high:29.5%,每题约 12 万输出 Token
  • Claude Fable 5 max:39.5%,仍然最高

这个结果比“多赢两个点”更实用。

Agent 写代码不是只付答案的钱,失败重试、无效思考和超长轨迹都要付钱。

如果同一类任务做得更准、输出还更短,真实账单和等待时间都会一起下降。

当然,这仍然是官方私有 benchmark。

拿自己的仓库做 A/B 测试,永远比转发柱状图靠谱。

# 四、真正意外的,是安全能力长得太快

这次发布标题里没有只写 Coding,还写了 Emergent Cyber Capabilities。

智谱原本把漏洞发现数据和环境加入后训练,是想让模型更会找漏洞。

结果继续 Scaling 后,模型不只会指出单点问题,还开始串联漏洞分析、验证和完整利用链。

GLM-5.3安全能力跑分

三项数据要分开看:

  • CyberGym:84.5%,高于 GLM-5.2 的 77.2%,也略高于 Fable 5 和 GPT-5.6 Sol
  • ExploitBench:54.4%,是 GLM-5.2 的 24.4% 的两倍多
  • ExploitGym:两小时完成 105 项、六小时 130 项;GLM-5.2 分别是 29 和 39 项

但越接近真实利用,闭源前沿模型的领先也越明显。

ExploitBench 上 Fable 5 是 78.0%,GPT-5.6 Sol 是 76.5%;ExploitGym 六小时,Fable 5 完成 247 项。

GLM-5.3 的结论不是“安全能力全面第一”,而是它在原本差距最大的利用链上,增长速度最快。

智谱还称,从 GLM-5.2 开始与国内安全团队合作,经过专家复核、筛选和去重,模型在 269 个项目里发现了 2436 个漏洞,其中 1097 个为严重或高危问题。

这些数字已经被放进 Z.ai Security Disclosure Ledger (opens new window) 持续披露。

这也是一个必须正视的边界。

漏洞发现可以帮维护者提前修复,也可能降低攻击门槛。

官方因此把权重开放往后放两周,先做安全评估和加固。

这个等待不是“开源跳票”的小事,是能力真的跨过了一条风险线。

# 五、价格没涨,但 API 迁移有一个坑

按照 Z.ai 官方价格页 (opens new window),GLM-5.3 和 GLM-5.2 单价相同:

每百万 Token GLM-5.3
输入 1.4 美元
缓存输入 0.26 美元
输出 4.4 美元

价格没变,能力更强、平均输出更少,这才是 5.3 最直接的性价比提升。

Coding Plan 已经全量切到 5.3,并改成积分额度;工作日 14:00—18:00 是高峰,其他时间和周末按 50% 积分消耗。

但准备把 API 从 5.2 改到 5.3 的录友,别只换模型 ID。

GLM-5.3 API迁移参数

GLM-5.3 强制开启思考。

如果旧代码还在传:

{"thinking": {"type": "disabled"}}
1

要先改成:

{
  "model": "glm-5.3",
  "thinking": {"type": "enabled"},
  "reasoning_effort": "low"
}
1
2
3
4
5

再切模型 ID,否则请求会直接失败。

复杂编程任务官方推荐 max;想控制延迟和成本,就从 low 或 high 开始测。

这三个档位不是越高越好。

一个能自动验收的批量任务,用 low 跑两次,可能比 max 跑一次更划算。

# 六、和 Kimi K3、DeepSeek V4、Claude 怎么选

别站队,算三笔账:失败成本、数据边界、任务规模。

你的任务 更适合谁 原因
复杂 Coding Agent,想兼顾能力与 Token 成本 GLM-5.3 长程能力涨幅大,官方私榜 Token 效率不错,API 价格不变
前端视觉、交互和原生多模态 Kimi K3 K3 的视觉理解和前端审美更突出,GLM-5.3 当前只支持文本
高失败成本的最难工程任务 Claude Fable 5 / GPT-5.6 Sol 多项前沿评测仍更强,失败一次的代价高时先买成功率
批量任务、价格敏感、结果可自动验证 DeepSeek V4 重点算吞吐和总成本,不必每一步都上最贵模型
代码不能外传、必须私有化 等 GLM-5.3 权重开放后实测 截至本文写作时权重尚未发布,别拿未来承诺替代当前交付

如果你已经在用 GLM Coding Plan,直接拿正在做的仓库试 5.3。

重点看四个指标:一次成功率、总输出 Token、完成时间、人工接管次数。

如果你等的是私有化部署,先别急。

等权重、许可证、推理框架支持和第三方量化一起落地,再算显存和吞吐账。

# 写在最后

GLM-5.3 最值得记住的,不是“又一个国产模型刷新跑分”。

而是它证明了:基座不变,靠真实环境、可验证奖励和更长的后训练,仍然能把 Agent 能力往上推一大截。

但安全能力的意外爆发,也提醒所有人:模型越会完成真实工作,能力和风险就越难拆开。

先拿真实任务测。

别拿发布会的蓝柱子替你做决定。

资料核对:

  • 官方发布页:https://z.ai/blog/glm-5.3
  • 模型文档:https://docs.z.ai/guides/llm/glm-5.3
  • API 价格:https://docs.z.ai/guides/overview/pricing
  • 安全披露台账:https://cvd.z.ai/
Last Updated: 8/20/2026, 2:33:29 PM

← 大模型面经汇总 DeepSeek Harness安装与使用 →

评论

验证登录状态...

侧边栏 侧边栏
夜间模式 夜间
卡码简历 卡码简历
代码随想录 代码随想录
卡码投递表 卡码投递表🔥
2026实习校招群 2026群
添加客服微信 2026实习校招客服微信 PS:通过微信后,请发送姓名-学校-年级-2026实习/校招
支持卡码笔记 支持卡码笔记
鼓励/支持/赞赏Carl 卡码笔记赞赏码
1. 如果感觉本站对你很有帮助,也可以请Carl喝杯奶茶,金额大小不重要,心意已经收下
2. 希望大家都能梦想成真,有好的前程,加油💪