AI 前沿·阅读约 2 分钟·
GLM-5.3:只靠 post-training 缩放,编码能力提升 50%,还意外长出了网络攻防能力

GLM-5.3:只靠 post-training 缩放,编码能力提升 50%,还意外长出了网络攻防能力

智谱发布 GLM-5.3,全部增益来自后训练阶段的环境与算力扩展:编码能力较 5.2 提升 50%,在漏洞挖掘基准上达到开源模型最强,还端到端发现了 2436 个真实漏洞。

原文来源:Z.ai Blog — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities — GLM-5.3 与 5.2 共用同一底座,一个月的"纯后训练缩放"换来了编码能力 50% 的提升和涌现的漏洞挖掘能力。

8 月 14 日,智谱发布了 GLM-5.3。这篇发布博客最值得注意的地方,是它把整件事说得异常简单:GLM-5.3 和 GLM-5.2 用的是同一个基础模型,所有的进步全部来自 post-training(后训练)阶段的扩展。

换句话说,这次没有新架构、没有更大规模的预训练、没有换数据配方,只是把去年以来攒下的那套后训练基础设施——长任务强化学习框架 SAO、高效长上下文处理的 IndexShare、开源的大规模异步训练框架 slime——继续往上堆算力和环境。堆了一个月,结果是:

  • 编码能力:内部 Z.ai Code Bench 上较 5.2 提升 50%;公开基准上拿下开源模型最强,包括 Terminal Bench 3.0 和 Agents' Last Exam。
  • 网络攻防能力(涌现):在 CyberGym 漏洞挖掘基准上达到 SOTA(84.5%),越往利用链深处走,相对 5.2 的提升越大——利用阶段基准上直接翻倍。
  • 开源计划:权重将在两周后发布,先做安全评估和加固。

为什么"环境"成了后训练的核心瓶颈

文章里有个判断很值得玩味:随着 agent 能力变强,后训练扩展的难点从模型本身转移到了环境上

要训练一个能做长任务的 agent,光有模型和奖励函数不够,你需要大量"可执行、可验证、接近真实专业工作"的任务环境。过去这类环境靠人工一个个搭,根本撑不起规模化训练。GLM-5.3 的做法是建了一条全自动的环境合成流水线:

  1. 研究 agent 从真实工作中收集任务模式;
  2. 把它们变成带多步依赖和隐藏状态的可运行长任务环境;
  3. 一个 judge agent 先试做一遍,验证任务真的可解;
  4. 验证器在不知道参考答案的情况下合成,再用求解轨迹来发现并堵住奖励捷径。

通过 oracle、no-op、未解状态三重检查的验证器,会产生足够可靠的二值奖励,直接拿去训练。这套管线目前仍然需要不少人工参与,让环境生成和验证更加自动化是下一步的方向。

效果是实打实的:GLM-5.3 在 Terminal-Bench 3.0 上从 4.6 冲到 28.3,DeepSWE v1.1 从 46.2 升到 66.9,Agents' Last Exam 从 23.8 到 28.5。这些任务不少相当于资深工程师好几天的活——比如一个 ML 基础设施任务里,模型要拿到和工程师一样的工作环境:计算集群、存储系统、内部文档、代码库、实验结果,自己诊断训练栈的瓶颈、实现优化、跑实验,最后交付可测量的端到端加速,还要保证正确性。

—— 广告 ——

同样重要的:token 效率

除了分数,GLM-5.3 还有个容易被忽略的变化——更强的能力,更少的输出 token

  • Max effort 档:GLM-5.3 达到 34.5% 完成率,每任务约 75K 输出 token;GLM-5.2 是 23.4% @ 96K。
  • High effort 档:GLM-5.3 达到 31.4% @ 约 50K token,超过 Claude Opus 4.8 的 29.5% @ 120K。
  • 相比 Claude Fable 5(Max 档 39.5%)仍有差距。

对 API 用户来说,这个数字直接换算成账单。同样的任务,更少的思考 token、更准的结果,意味着实际使用成本比单纯看分数下降得更多。

另外智谱还引入了内部基准 Z.ai Code Bench:覆盖多样任务类别,把 agent 放进复杂的本地开发环境,按不同 effort 档位评估端到端完成率和细粒度清单准确率。作为私有基准,它降低了公共测试集污染的风险,也能更真实地反映用户体验。

涌现的网络攻防能力

这是整篇博客最有戏剧性的部分。后训练阶段加入了漏洞发现数据和环境,团队预期模型会更擅长找漏洞、推理漏洞——但没想到能力会随着训练规模涨得这么快

GLM-5.3 不只是更擅长识别孤立的缺陷:它开始跨多个利用阶段推理,形成完整的利用链计划。三个基准的表现:

基准GLM-5.3GLM-5.2说明
CyberGym84.577.2白盒源码漏洞识别,开源最强,超过 Mythos 5(83.8)和 GPT-5.6 Sol(83.6)
ExploitBench54.424.4真实漏洞利用推理,翻倍,但落后闭源(Mythos 5 78.0)
ExploitGym 2h/6h105/13029/39时间归一化后的利用任务完成数,闭源领先(181/247)

三个基准呈现一致的规律:越靠近利用链深处,相对 GLM-5.2 的提升越大,与闭源前沿的差距也越大。能力增长最快的地方,恰恰是最落后的地方。

更值得注意的是能力迁移到了真实世界。自 GLM-5.2 以来,智谱与国内多个安全团队合作,让模型对真实代码库做漏洞排查。经过专家评审、筛查和去重后,模型在 269 个项目里找到了 2436 个漏洞,其中 1097 个是中高危。覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议。很多漏洞藏了多年甚至几十年,最老的一个可以追溯到 1981 年,平均"潜伏期"26.6 年。

这项工作已经发展成一个持续的披露流程,Z.ai Security Disclosure Ledger(cvd.z.ai)公开记录所有发现的状态:目前 53 个已公开披露、2383 个仍在保密期。

支撑这一切的 slime 框架

GLM-5.3 的后训练跑在 slime 上(THUDM/slime,开源),设计上把训练、rollout 和数据缓冲放在同一条数据流里——数学、代码、沙箱、验证器、长任务 agentic 环境都以"数据生成"的形式接入,而不是每次都要改训练循环。这让 5.2 到 5.3 的环境扩展不需要重建训练栈。

这个月 slime 有两个方向的更新:

算法侧:加入 top-p mask、top-k 和全词表 OPD(在线策略蒸馏),以及提升训练-rollout 一致性的配置——包括 R3 风格设置和训练/rollout 路径的完全数值对齐。一致性评估中,训练与 rollout 的 logprob 平均差异被控制在 1e-7 量级,比之前降低了 99.99% 以上。

系统侧:本地存储成为额外缓存层,分层存放模型状态和数据;多教师 OPD 支持动态切换教师和预取,不用为每个教师单独起一个常驻推理服务;针对 agentic 异步负载改进了 router 与 slime 的联合调度和负载均衡,按 rollout 环境的特征推导吞吐导向配置(prefill/decode 资源比、并发设置等)。结果是:长任务编码 RL 的端到端训练吞吐提升了 2.3 倍以上

API 变化:不再支持关闭思考

对开发者来说,GLM-5.3 有一个必须注意的破坏性变更:不再支持禁用思考

  • thinking.type 只有 enableddisabled 已移除;
  • reasoning_effort 支持 low / high / max(默认 max),编码任务官方推荐 max

如果应用目前用的是 thinking.type: "disabled",必须先改成 enabled + reasoning_effort: "low",再升级模型 ID 到 glm-5.3,否则请求会直接失败。

权重两周后开放,届时可以本地部署。GLM Coding Plan 用户已全部升级到 5.3,配额改为点数制,非高峰时段(工作日 14:00-18:00 之外)消耗减半。

一点观察

GLM 这轮迭代的路径很有意思:预训练权重两年没大动,全靠后训练的工程化能力(环境合成、奖励设计、RL 基础设施)在追闭源前沿。这在行业里是一种"省钱"的追赶策略——预训练一次的成本是天文数字,而环境合成和 RL 循环虽然也烧钱,但边际成本可控,且能持续复用。

与此同时,"涌现的网络攻防能力"也把安全问题的复杂性摆到了台面上:模型越强,越需要提前做安全评估和加固,这大概也是权重推迟两周发布的原因。开源的攻防双刃剑,接下来几个月应该会有更多讨论。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/ai/glm-5-3-posttraining-coding