GLM-5.3 评测:不换基座,纯靠后训练硬拉出开源编程第一

同样是开源模型,有的靠堆参数,有的靠堆数据,智谱这次选了第三条路:基座一个字不动,只把后训练规模拉到极限。GLM-5.3 的编程能力比前代直接涨了一半,终端基准分数翻了数倍,还顺手把网络安全这个新赛道的开源榜首也拿了。权重两周后开源,现在多个编码平台已经能免费上手。

这到底是什么

GLM-5.3 是智谱 Z.ai 在 2026 年 8 月 14 日发布的新一代开源基座模型,总参数 7430 亿。它最大的反常之处在于:跟上一代 GLM-5.2 相比,基座模型完全没有改动,所有能力提升全部来自后训练阶段的规模化。官方说法是,通过数十倍的长程任务环境、更丰富的环境类型和超长的后训练时间,充分的后训练涌现出了超出预期的能力。

这件事的意义在于,它给”模型还能怎么变强”这个行业命题提供了一个新答案。过去一年大家比的是参数量和数据规模,GLM-5.3 却用同一套基座,把编程能力拔高了 50%,重新挤进全球开源模型的第一梯队,编程与 Agent 能力已经逼近闭源前沿。

跟传统模型迭代的路子不同,GLM-5.3 的差异化很直接:不换底料,只换火候。这让它成为观察后训练 Scaling 路线到底能不能持续生效的一个绝佳样本。至于这份答卷值多少分,下面拆开看。

官网:https://z.ai | 官方漏洞披露台账:https://cvd.z.ai

GLM-5.3 评测:不换基座,纯靠后训练硬拉出开源编程第一

到底强在哪

光说”变强了”太虚,我们直接看它到底强在哪些地方。

编程能力:开源第一,Token 还省

GLM-5.3 最硬的一张牌是编程。在智谱自研的 Z.ai Code Bench 上,它比 GLM-5.2 提升了 50%。这个基准不是刷分用的题库,而是把模型放进真实本地开发环境,让它端到端跑完编码任务,尽量模拟开发者用 Coding Agent 的真实体感。

更值得说的是效率。High 档位下 GLM-5.3 拿到 31.4% 的准确率,超过了 Claude Opus 4.8 最高档的 29.5%,但每项任务平均只花约 5 万 Token,而 Opus 4.8 要烧掉约 12 万。翻译成人话就是:它用更短的执行路径,把活干成了。

公开基准也站得住。Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 涨到 66.9,Agents’ Last Exam 从 23.8 涨到 28.5,三个都是开源第一。下面这张图能直观看到这轮后训练的跃升幅度。

GLM-5.3 评测:不换基座,纯靠后训练硬拉出开源编程第一

网络安全:练着练着意外觉醒的能力

如果说编程是预期内的提升,网络安全就是这次发布最出圈的意外。随着后训练规模放大,模型不再只是识别孤立漏洞,而是能跨多个阶段推理、规划出完整的利用链。在漏洞推理基准 CyberGym 上,GLM-5.3 拿到 84.5%,超过了 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。

这个能力不是纸面功夫。发布前智谱联合清华、南开和多家头部安全团队做红队测试,在 269 个开源项目里挖出 2436 个漏洞,其中 1097 个是中高危。最夸张的一个是潜伏 40 多年的 DNS 协议级风险,攻击者用少量特殊请求就能把服务器压力放大近 8 万倍,潜在影响超 1000 万处公网 DNS 服务。

有意思的是,这套攻防能力是”涌现”出来的,团队立项时并没有把网络安全当成目标。这也带来一个现实问题:能力越强,越要先做安全加固再开源,官方因此把权重开放推迟了两周。

后训练 Scaling:全部增益的源头

为什么能靠后训练涨这么多?核心是一套叫 slime 的开源后训练框架。训练侧用 Megatron,rollout 侧用 SGLang,把训练、rollout、数据缓冲放进同一条数据流,数学、代码、沙箱、长程 Agent 环境都作为数据生成接入。下面这张架构图能看清整条链路。

GLM-5.3 评测:不换基座,纯靠后训练硬拉出开源编程第一

算法层面,slime 新增了 top-p mask、top-k 与全词表 OPD,配合 SAO 和 compaction 策略,保证增益在长程任务上也站得住,而不是只对短任务有效。训练与 rollout 一致性的对数概率差异控制在 1e-7 量级,比此前配置降低了 99.99% 以上。官方还留了一句耐人寻味的话:这个基座的上界可能远没被开发出来。

实际跑一遍

看完功能,肯定想知道这东西现在怎么才能用上。

GLM-5.3 不是独立 App,它通过编码平台接入。现在最快的路径是打开智谱自家的 ZCode,或者你已经装好的 WorkBuddy、CodeBuddy,在模型列表里切到 GLM-5.3,然后直接丢需求。整个过程不用下载,也不用填一堆表单,登录账号就能跑。

我第一次试的是让它在终端里排查一个服务的启动报错。它没有只甩一段代码给我,而是先读日志、定位到配置文件里的一个端口冲突,再给出修改方案。体感上比上一代明显更像个会自己动手的工程师,而不是只会问答的聊天框。

要吐槽的点也有两个。一是 API 还没上线,想用第三方工具接它得再等等;二是权重要到两周后才开源,本地部署派暂时只能眼馋。下面这张流程图把完整的上手路径理了一遍。

GLM-5.3 评测:不换基座,纯靠后训练硬拉出开源编程第一

效率翻倍技巧

这一章聊点实用的,很多人不知道还有这些进阶用法。

  • 别开最高档:High 档位 31.4% 的准确率已经压过 Opus 4.8 最高档,Token 却只花对方四成。日常写码用 High 档,性价比最高。
  • 长任务拆成链:SAO 加 compaction 策略对长程任务友好,把一个大需求拆成”定位、修改、验证”三环,比一次性丢完整需求成功率更高。
  • 白盒审查直接喂源码:在安全审查场景,把源码和漏洞线索一起给它,它会沿着调用链往下追,比让它凭空猜有效得多。
  • 等权重开源后本地跑:两周后权重放出,可以在自己的机器上部署,数据不出内网,适合对合规敏感的企业场景。
  • 多平台切换对比:GLM-5.3 同时接入了十来个编码平台,同一个任务在 ZCode 和 WorkBuddy 里各跑一遍,能明显感受到它的稳定性。

和同类比怎么样

开源编程模型这条赛道最近挤得很满,Kimi K3、DeepSeek V4 Pro 都是绕不开的对手,闭源那边还有 Claude Fable 5 压阵。直接看对比:

维度 GLM-5.3 Kimi K3 DeepSeek V4 Pro Claude Fable 5
开源 是(两周后放权重)
核心定位 编程 + 安全 长程软件工程 Agent 智能体 全能闭源
Terminal-Bench 3.0 28.3 17.4 未公开 未公开
DeepSWE v1.1 66.9 67.5 未公开 未公开
CyberGym 84.5% 未公开 未公开 未公开
发布节奏 2026-08-14 2026 年 2026-08-13 2026 年

差距最清楚的一点在终端操作:Terminal-Bench 3.0 上 GLM-5.3 的 28.3 几乎是 Kimi K3 的 1.6 倍。但在长程软件工程这个维度,Kimi K3 的 DeepSWE 反而高了 0.6 分,双方咬得很紧。真正的护城河是网络安全,这块目前开源阵营里没有对手能对齐。

真实用户怎么说

模型刚发布三天,社区讨论已经很热闹,正反声音都挺典型。

认可的声音集中在两点:

一是编程体感确实上来了,不少开发者反馈它改代码时”真的会去读上下文,而不是瞎猜”;

二是 Token 效率高,同样的任务花销比某些闭源模型省一半。安全圈的反应更兴奋,有人把它当成白盒审计的免费劳动力。

吐槽的点同样明确。最集中的一条是”开源了,又没完全开源”,权重推迟两周让一部分等着本地部署的人不太舒服。还有人觉得基座没换,本质是”5.2 的加强版”,对后续能不能继续涨持观望态度。API 未上线也让急着做产品的人干等。

多维评分

聊了这么多,把它拆成八个维度打个分,好有个直观的底。

维度 权重 星级 一句话解读
功能完整性 20% ⭐⭐⭐⭐⭐ 编程、Agent、安全三线齐开
易用性 15% ⭐⭐⭐⭐☆ 接入多平台,切换即用
性能表现 15% ⭐⭐⭐⭐⭐ 基准暴涨,Token 还省
AI 能力 15% ⭐⭐⭐⭐⭐ 后训练涌现超预期能力
价格合理性 10% ⭐⭐⭐⭐☆ 权重免费,API 定价未出
生态集成 10% ⭐⭐⭐⭐⭐ 十余个编码平台抢先接入
文档与支持 10% ⭐⭐⭐⭐☆ 技术报告加 slime 开源
更新频率 5% ⭐⭐⭐⭐☆ 后训练迭代快,基座待换

综合评分:8.6 / 10

优点和槽点

优势

  • 编程开源第一:多个公开基准登顶,比前代整体提升 50%,逼近闭源前沿。
  • Token 效率突出:High 档准确率反超 Opus 4.8,Token 消耗却只有其四成。
  • 安全能力稀缺:CyberGym 84.5% 登顶,开源阵营目前唯一能打的攻防选手。
  • 后训练范式验证:不换基座硬拉 50%,为 Scaling 路线提供了有力样本。

不足

  • 权重延迟开源:要等两周安全加固,本地部署派暂时用不上。
  • API 尚未上线:第三方集成还需等待,产品化接入有门槛。
  • 基座未更新:能力提升全部靠后训练,底料本身没有升级。

适合谁用

前面把优缺点都摊开了,那它到底更适合哪些人上手。

  • 编程 Agent 重度用户:日常靠 Coding Agent 干活的人,切到 GLM-5.3 能明显感到长程任务更稳,Token 还更省。
  • 安全从业者与白帽:白盒代码审查、漏洞挖掘是它的强项,可以当免费的审计辅助。
  • 想自建私有化编码能力的企业:两周后权重开源,合规敏感场景可以本地部署。
  • 开源模型研究者:后训练 Scaling 的完整技术栈连同 slime 框架一起放出,值得研究。
  • 不太适合纯对话用户:如果只是日常闲聊、写文案,它的长板你用不上,闭源对话模型体验反而更顺。

值这个价吗

截至 2026 年 8 月 17 日,GLM-5.3 的 API 定价尚未公布,能确定的是权重将在两周内免费开源,GLM Coding Plan 已向全量用户开放并重置了额度。当前的成本结构大致如下:

获取方式 价格 说明
编码平台接入 免费 ZCode、WorkBuddy 等直接切换
GLM Coding Plan 订阅制 额度已重置,可查用量统计
开源权重 免费 两周后开放,可本地部署
API 待公布 官方称很快上线

从价值角度看,权重免费开源这一点已经把成本优势拉满了。真正的悬念在 API 定价,如果对标同档开源模型的按量计费,它的 Token 效率优势会让单任务成本比闭源低不少。对个人开发者来说,现在就是零成本试用的窗口期。

常见问题

这些是发布三天来被问得最多的问题,一次性说清楚。

Q1:GLM-5.3 开源吗?什么时候能下载权重?

A1:开源,但要等两周。 官方计划发布两周后开放完整权重,此前需要完成安全评估与加固,把潜在攻击能力限制住、保留防御价值。

Q2:现在怎么用上 GLM-5.3?

A2:通过编码平台切换即可。 ZCode、AutoClaw 已上线,TraeWork、WorkBuddy、CodeBuddy、扣子等十余个平台开放抢先体验,登录后在模型列表选 GLM-5.3 就能跑。

Q3:API 上线了吗?价格多少?

A3:还没上线,定价未公布。 官方称 API 很快上线,截至 2026 年 8 月 17 日尚无具体价格,想通过第三方工具接它需要再等等。

Q4:和 GLM-5.2 比强在哪?

A4:编程整体提升 50%,新增安全能力。 基座完全没变,全部增益来自后训练,三大公开基准涨幅都超过四成,网络安全更是从无到有。

Q5:它适合日常聊天吗?

A5:不是它的主战场。 GLM-5.3 的重心是编程与 Agent 任务,日常闲聊、写文案用它有点大材小用,闭源对话模型体验反而更顺。

Q6:网络安全能力会不会被滥用?

A6:官方已做防护。 正是考虑到这一点,智谱才推迟两周开源,先做安全加固,尽量限制攻击能力、保留防御价值,同时建立漏洞披露台账。

Q7:本地部署需要什么配置?

A7:参考 7430 亿参数规模。 完整权重需要较高的显存与算力,量化后门槛会降低,具体配置等权重放出后看官方部署文档为准。

Q8:和 DeepSeek V4 Pro、Kimi K3 比谁强?

A8:各有胜负,安全是独家。 终端操作 GLM-5.3 领先明显,长程软件工程 Kimi K3 略高,DeepSeek V4 Pro 强在 Agent,网络安全则是 GLM-5.3 独占。

Q9:有免费额度吗?

A9:有,且已重置。 8 月 14 日 13:00 起 GLM Coding Plan 全员额度重置,后台用量统计可见额度回满,可直接上手体验。

Q10:适合什么人用?

A10:编程与安全场景最对口。 编程 Agent 重度用户、安全从业者、想私有化部署的企业是核心人群,纯对话用户则不太必要。

所以该入手吗

GLM-5.3 是一次很有说服力的技术表态:不靠堆参数,单靠后训练也能把能力上限抬高一截。对在编程 Agent 上投入大量时间的人,以及安全从业者来说,它是当下开源阵营里几乎不用犹豫的选择。

但如果你只是想要一个日常聊天的模型,或者急着通过 API 做产品集成,现在还不是最佳时机,可以等 API 定价和权重放出之后再决定。

一句话:代码写得多的,现在就该切过去试试,反正免费。

AI工具

MiniMax Music 3 评测:开源权重,把"5 分钟完整长歌"做成了标配

2026-8-17 8:20:01

实战分享

Agent Skill规范、构建与设计模式

2026-5-12 8:31:35

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧