GLM-5.2 vs GLM-5.3:编程提升50%,同基座后训练跃迁实测
GLM-5.3 与 GLM-5.2 同基座后训练跃迁:编程提升约 50%,Terminal-Bench 3.0 从 4.6 升至 28.3,安全漏洞利用翻倍,API 单价不变,token 更省。适合 Coding Agent 与安全审计选型。

智谱于 2026 年 8 月 14 日正式发布 GLM-5.3,与上一代 GLM-5.2 的关系并非传统的版本迭代。两者共享同一基座模型,总参数量均为 7430 亿,采用 MoE 混合专家架构,每个 token 激活约 40B 参数,架构没有变化,上下文行为一致。所有能力提升都来自后训练阶段的规模化投入:数十倍的长程任务环境、更丰富多样的环境类型,以及显著延长的强化学习训练时间。
这种 “不换底座、只炼后训” 的路线,决定了对比的焦点不在于模型规模,而在于训练策略如何重新定义同一基座的智能上界。
一、编程能力:基准测试中的真实差距
编程是 GLM-5.3 提升最显著的维度。智谱内部 Z.ai Code Bench 体感评测显示,GLM-5.3 的编程能力较 GLM-5.2 提升约 50%。这一主观感受在公开基准中得到了量化验证。
最具标志性的是 Terminal-Bench 3.0,该基准考察模型在真实终端环境中完成多步复杂任务的能力。GLM-5.2 在此项得分为 4.6,接近基线水平;GLM-5.3 跃升至 28.3,提升幅度超过六倍,达到开源模型第一。这一数据说明 GLM-5.2 在需要跨终端操作、环境交互的长链路任务上存在明显短板,而 GLM-5.3 的后训练环境恰好覆盖了这类场景。
DeepSWE v1.1 聚焦长程软件工程与持续代码修改,GLM-5.2 得分为 46.2,GLM-5.3 提升至 66.9,增长约 45%。Agents‘ Last Exam(CLI)覆盖跨工具协作与长程 Agent 任务,得分从 23.8 提升至 28.5。SWE-Marathon 的涨幅更为显著,从 19.4 翻倍至 42.5。在覆盖 44 种职业、考察真实高价值知识工作的 GDPval-AA v2 中,GLM-5.3 得分 1769,同样展现出编程能力向专业任务执行的自然延伸。
值得注意的是一组来自 Z.ai Code Bench 的效率数据。在 High 推理档位下,GLM-5.3 达到 31.4% 的准确率,超过 Claude Opus 4.8 最高档位的 29.5%;完成单任务平均输出约 5 万 tokens,而 Opus 4.8 需要约 12 万 tokens。这意味着 GLM-5.3 不仅准确率更高,执行路径也明显更短。同一基准下,GLM-5.2 在 Max 档位的表现为 23.4% 准确率配约 9.6 万 tokens,GLM-5.3 在 Max 档位达到 34.5% 准确率,tokens 消耗降至约 7.5 万。准确率与 token 效率同时改善,表明后训练优化没有以增加推理开销为代价。
二、网络安全:后训练规模扩大后的能力涌现
网络安全能力的跃升是 GLM-5.3 超出预期的一个维度。官方表述称 “随着后训练规模持续扩大,模型的网络安全能力以超出预期的速度提升”,越深入漏洞利用链,相较 GLM-5.2 的提升越显著。
CyberGym 漏洞推理评测中,GLM-5.2 得分为 77.2%,GLM-5.3 达到 84.5%,略高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。ExploitBench 的差距更加悬殊:GLM-5.2 为 24.4,GLM-5.3 达到 54.4,翻了一倍以上。在漏洞利用类任务中,GLM-5.3 的得分是 GLM-5.2 的两倍以上。在 ExploitGym 限定时间测试中,GLM-5.3 在两小时内完成 105 项漏洞利用任务,六小时内完成 130 项,而 GLM-5.2 同等时间内仅完成 29 项和 39 项。
这些数据背后有实际落地案例支撑。模型发布前两周,智谱联合安全团队利用 GLM-5.3 发现了 2404 个潜在漏洞,其中 1088 个为中高危级别。研究人员还借助该模型识别出一个潜伏四十余年的 DNS 协议级风险,攻击者仅需少量特殊请求即可将服务器压力放大近 8 万倍,潜在影响超过 1000 万处公网 DNS 服务。这是 Benchmark 分数转化为真实安全价值的直接证据。
三、Token 效率与成本经济性
模型升级带来的成本变化是工程团队关注的核心问题。GLM-5.2 与 GLM-5.3 在智谱官方 API 定价上完全一致。
单价不变,但单位任务的 token 消耗在变化。前文已提到,GLM-5.3 在 Z.ai Code Bench 上以更少的 token 完成更高的准确率。对于批量编程任务或长链路 Agent 工作流,这种效率提升会直接传导为账单的下降。
不过,版本升级后的 token 消耗结构也出现了新的变化。结构化输出中可能夹带分析过程和解释,导致输出 token 增加;多轮对话中上下文被反复传递,进一步放大了消耗。工程团队在迁移时需要注意提示词压缩、上下文裁剪和输出格式控制,避免 “单价不变但总费用上涨” 的情况。在 API 网关层做统一的路由和用量监控,可以帮助定位异常的 token 消耗点 —— 这也是 KoalaAPI 这类工具的设计初衷之一。
此外,GLM-5.3 的思考模式发生了不可逆的变更。GLM-5.2 允许通过 thinking.type: "disabled" 关闭思考功能,而 GLM-5.3 始终启用思考,仅支持 low、high、max 三个强度档位,默认值为 max。如果现有应用仍使用禁用思考的配置,迁移到 glm-5.3 时将直接报错,必须将 thinking.type 改为 enabled 并设置 reasoning_effort 为 low 或更高档位。这是一次性迁移成本,但需要纳入上线计划。
四、架构分化:GLM-5.3 与 GLM-5.3-Flash 的路线差异
GLM-5.3 发布两周后,智谱开源了 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型。两者虽然共享 “5.3” 的版本号,但架构路线截然不同。
GLM-5.3 仅支持文本模态,1M 上下文窗口,最大输出 128K。GLM-5.3-Flash 则支持文本、图片、视频和视觉文档输入,采用 MoE 混合专家架构,320B 总参数,每 token 仅激活 18B 参数,层数从 GLM-5.2 的 92 层压缩至 45 层。该模型是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,相较于 GLM-5.3,注意力计算量降低 3.01 倍,KV 缓存大小降低 4.44 倍。
AA 综合智能指数得分为 57 分,与 Claude Opus 4.8 持平,高于 GLM-5.2。
在正式发布前,GLM-5.3-Flash 以匿名模型 Ox Alpha(中文社区称 “牛来”)在 OpenRouter 和 OpenCode 上进行大规模测试,Token 调用量达到 62T,登顶双平台用量榜。全部线上流量由 10 万张国产芯片承载。这一算力部署规模为国产芯片在真实全球负载下的大规模服务提供了参照。
对于需要多模态输入或极致成本敏感的场景,GLM-5.3-Flash 是更实际的选择;对于纯文本编程和 Agent 任务,GLM-5.3 的文本深度优化更为匹配。当文本模型与多模态模型并行部署时,按任务类型路由通常比在应用层硬编码供应商判断更易维护。KoalaAPI 可作为这一层的统一入口,由网关统一做协议适配、模型别名映射和路由分发。
五、选型建议
从 GLM-5.2 升级到 GLM-5.3 的收益是明确的。
编程能力提升 50%,Terminal-Bench 3.0 从近基线跃至开源第一,DeepSWE 长程工程能力提升约 45%,网络安全漏洞利用能力翻倍。API 单价不变,单位任务 token 效率改善。如果业务涉及 Coding Agent、自动化工作流或安全审计,升级的技术理由充分。
需要留意的迁移事项包括思考模式强制启用(必须调整 API 配置)、输出 token 可能因分析过程而增加(需监控和优化提示词策略),以及权重开源时间与安全评估的绑定。GLM-5.3 的完整模型权重计划在安全评估完成后约两周内开源。
GLM-5.3-Flash 则适合另一类场景:预算敏感、需要多模态理解、或以高并发调用为主。AA 智能指数 57 分也确认了它在能力上没有因低价而大幅妥协。
六、多模型接入的工程收敛
GLM-5.3 与 GLM-5.3-Flash 的路线分化,意味着同一业务可能同时需要纯文本编程模型、多模态模型和低成本高并发模型。如果每个服务直接对接不同供应商,thinking 参数、鉴权方式、计费口径和重试策略会散落在业务代码中,迁移和排障成本很高。
更可控的做法是把这些差异下沉到 API 网关:由网关统一做协议适配、模型别名映射、路由分发、限流重试和 token 用量归因。KoalaAPI 即按这一层定位,业务侧面向统一接口,后续替换模型或调整供应商时不必反复改造上层逻辑。对于正在评估 GLM-5.2 升级或 GLM-5.3-Flash 混合部署的团队,这种收敛方式比在应用层硬编码供应商判断更易维护。
从 GLM-5.2 到 GLM-5.3,变化集中在后训练能力;但工程侧的变化集中在参数、计费和路由。把差异收敛到 API 网关层,通常比在业务代码中逐项适配更可控。
>
> 了解更多:https://koalaapi.com

