同样是开源模型,有的靠堆参数,有的靠堆数据,智谱这次选了第三条路:基座一个字不动,只把后训练规模拉到极限。GLM-5.3 的编程能力比前代直接涨了一半,终端基准分数翻了数倍,还顺手把网络安全这个新赛道的开源榜首也拿了。权重两周后开源,现在多个编码平台已经能免费上手。
这到底是什么
GLM-5.3 是智谱 Z.ai 在 2026 年 8 月 14 日发布的新一代开源基座模型,总参数 7430 亿。它最大的反常之处在于:跟上一代 GLM-5.2 相比,基座模型完全没有改动,所有能力提升全部来自后训练阶段的规模化。官方说法是,通过数十倍的长程任务环境、更丰富的环境类型和超长的后训练时间,充分的后训练涌现出了超出预期的能力。
这件事的意义在于,它给”模型还能怎么变强”这个行业命题提供了一个新答案。过去一年大家比的是参数量和数据规模,GLM-5.3 却用同一套基座,把编程能力拔高了 50%,重新挤进全球开源模型的第一梯队,编程与 Agent 能力已经逼近闭源前沿。
跟传统模型迭代的路子不同,GLM-5.3 的差异化很直接:不换底料,只换火候。这让它成为观察后训练 Scaling 路线到底能不能持续生效的一个绝佳样本。至于这份答卷值多少分,下面拆开看。
官网:https://z.ai | 官方漏洞披露台账:https://cvd.z.ai

到底强在哪
光说”变强了”太虚,我们直接看它到底强在哪些地方。
编程能力:开源第一,Token 还省
GLM-5.3 最硬的一张牌是编程。在智谱自研的 Z.ai Code Bench 上,它比 GLM-5.2 提升了 50%。这个基准不是刷分用的题库,而是把模型放进真实本地开发环境,让它端到端跑完编码任务,尽量模拟开发者用 Coding Agent 的真实体感。
更值得说的是效率。High 档位下 GLM-5.3 拿到 31.4% 的准确率,超过了 Claude Opus 4.8 最高档的 29.5%,但每项任务平均只花约 5 万 Token,而 Opus 4.8 要烧掉约 12 万。翻译成人话就是:它用更短的执行路径,把活干成了。
公开基准也站得住。Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 涨到 66.9,Agents’ Last Exam 从 23.8 涨到 28.5,三个都是开源第一。下面这张图能直观看到这轮后训练的跃升幅度。

网络安全:练着练着意外觉醒的能力
如果说编程是预期内的提升,网络安全就是这次发布最出圈的意外。随着后训练规模放大,模型不再只是识别孤立漏洞,而是能跨多个阶段推理、规划出完整的利用链。在漏洞推理基准 CyberGym 上,GLM-5.3 拿到 84.5%,超过了 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。
这个能力不是纸面功夫。发布前智谱联合清华、南开和多家头部安全团队做红队测试,在 269 个开源项目里挖出 2436 个漏洞,其中 1097 个是中高危。最夸张的一个是潜伏 40 多年的 DNS 协议级风险,攻击者用少量特殊请求就能把服务器压力放大近 8 万倍,潜在影响超 1000 万处公网 DNS 服务。
有意思的是,这套攻防能力是”涌现”出来的,团队立项时并没有把网络安全当成目标。这也带来一个现实问题:能力越强,越要先做安全加固再开源,官方因此把权重开放推迟了两周。
后训练 Scaling:全部增益的源头
为什么能靠后训练涨这么多?核心是一套叫 slime 的开源后训练框架。训练侧用 Megatron,rollout 侧用 SGLang,把训练、rollout、数据缓冲放进同一条数据流,数学、代码、沙箱、长程 Agent 环境都作为数据生成接入。下面这张架构图能看清整条链路。

算法层面,slime 新增了 top-p mask、top-k 与全词表 OPD,配合 SAO 和 compaction 策略,保证增益在长程任务上也站得住,而不是只对短任务有效。训练与 rollout 一致性的对数概率差异控制在 1e-7 量级,比此前配置降低了 99.99% 以上。官方还留了一句耐人寻味的话:这个基座的上界可能远没被开发出来。
实际跑一遍
看完功能,肯定想知道这东西现在怎么才能用上。
GLM-5.3 不是独立 App,它通过编码平台接入。现在最快的路径是打开智谱自家的 ZCode,或者你已经装好的 WorkBuddy、CodeBuddy,在模型列表里切到 GLM-5.3,然后直接丢需求。整个过程不用下载,也不用填一堆表单,登录账号就能跑。
我第一次试的是让它在终端里排查一个服务的启动报错。它没有只甩一段代码给我,而是先读日志、定位到配置文件里的一个端口冲突,再给出修改方案。体感上比上一代明显更像个会自己动手的工程师,而不是只会问答的聊天框。
要吐槽的点也有两个。一是 API 还没上线,想用第三方工具接它得再等等;二是权重要到两周后才开源,本地部署派暂时只能眼馋。下面这张流程图把完整的上手路径理了一遍。

效率翻倍技巧
这一章聊点实用的,很多人不知道还有这些进阶用法。
-
别开最高档:High 档位 31.4% 的准确率已经压过 Opus 4.8 最高档,Token 却只花对方四成。日常写码用 High 档,性价比最高。 -
长任务拆成链:SAO 加 compaction 策略对长程任务友好,把一个大需求拆成”定位、修改、验证”三环,比一次性丢完整需求成功率更高。 -
白盒审查直接喂源码:在安全审查场景,把源码和漏洞线索一起给它,它会沿着调用链往下追,比让它凭空猜有效得多。 -
等权重开源后本地跑:两周后权重放出,可以在自己的机器上部署,数据不出内网,适合对合规敏感的企业场景。 -
多平台切换对比:GLM-5.3 同时接入了十来个编码平台,同一个任务在 ZCode 和 WorkBuddy 里各跑一遍,能明显感受到它的稳定性。
和同类比怎么样
开源编程模型这条赛道最近挤得很满,Kimi K3、DeepSeek V4 Pro 都是绕不开的对手,闭源那边还有 Claude Fable 5 压阵。直接看对比:
| 维度 | GLM-5.3 | Kimi K3 | DeepSeek V4 Pro | Claude Fable 5 |
|---|---|---|---|---|
| 开源 | 是(两周后放权重) | 是 | 是 | 否 |
| 核心定位 | 编程 + 安全 | 长程软件工程 | Agent 智能体 | 全能闭源 |
| Terminal-Bench 3.0 | 28.3 | 17.4 | 未公开 | 未公开 |
| DeepSWE v1.1 | 66.9 | 67.5 | 未公开 | 未公开 |
| CyberGym | 84.5% | 未公开 | 未公开 | 未公开 |
| 发布节奏 | 2026-08-14 | 2026 年 | 2026-08-13 | 2026 年 |
差距最清楚的一点在终端操作:Terminal-Bench 3.0 上 GLM-5.3 的 28.3 几乎是 Kimi K3 的 1.6 倍。但在长程软件工程这个维度,Kimi K3 的 DeepSWE 反而高了 0.6 分,双方咬得很紧。真正的护城河是网络安全,这块目前开源阵营里没有对手能对齐。
真实用户怎么说
模型刚发布三天,社区讨论已经很热闹,正反声音都挺典型。
认可的声音集中在两点:
一是编程体感确实上来了,不少开发者反馈它改代码时”真的会去读上下文,而不是瞎猜”;
二是 Token 效率高,同样的任务花销比某些闭源模型省一半。安全圈的反应更兴奋,有人把它当成白盒审计的免费劳动力。
吐槽的点同样明确。最集中的一条是”开源了,又没完全开源”,权重推迟两周让一部分等着本地部署的人不太舒服。还有人觉得基座没换,本质是”5.2 的加强版”,对后续能不能继续涨持观望态度。API 未上线也让急着做产品的人干等。
多维评分
聊了这么多,把它拆成八个维度打个分,好有个直观的底。
| 维度 | 权重 | 星级 | 一句话解读 |
|---|---|---|---|
| 功能完整性 | 20% | ⭐⭐⭐⭐⭐ | 编程、Agent、安全三线齐开 |
| 易用性 | 15% | ⭐⭐⭐⭐☆ | 接入多平台,切换即用 |
| 性能表现 | 15% | ⭐⭐⭐⭐⭐ | 基准暴涨,Token 还省 |
| AI 能力 | 15% | ⭐⭐⭐⭐⭐ | 后训练涌现超预期能力 |
| 价格合理性 | 10% | ⭐⭐⭐⭐☆ | 权重免费,API 定价未出 |
| 生态集成 | 10% | ⭐⭐⭐⭐⭐ | 十余个编码平台抢先接入 |
| 文档与支持 | 10% | ⭐⭐⭐⭐☆ | 技术报告加 slime 开源 |
| 更新频率 | 5% | ⭐⭐⭐⭐☆ | 后训练迭代快,基座待换 |
综合评分:8.6 / 10
优点和槽点
优势
-
编程开源第一:多个公开基准登顶,比前代整体提升 50%,逼近闭源前沿。 -
Token 效率突出:High 档准确率反超 Opus 4.8,Token 消耗却只有其四成。 -
安全能力稀缺:CyberGym 84.5% 登顶,开源阵营目前唯一能打的攻防选手。 -
后训练范式验证:不换基座硬拉 50%,为 Scaling 路线提供了有力样本。
不足
-
权重延迟开源:要等两周安全加固,本地部署派暂时用不上。 -
API 尚未上线:第三方集成还需等待,产品化接入有门槛。 -
基座未更新:能力提升全部靠后训练,底料本身没有升级。
适合谁用
前面把优缺点都摊开了,那它到底更适合哪些人上手。
-
编程 Agent 重度用户:日常靠 Coding Agent 干活的人,切到 GLM-5.3 能明显感到长程任务更稳,Token 还更省。 -
安全从业者与白帽:白盒代码审查、漏洞挖掘是它的强项,可以当免费的审计辅助。 -
想自建私有化编码能力的企业:两周后权重开源,合规敏感场景可以本地部署。 -
开源模型研究者:后训练 Scaling 的完整技术栈连同 slime 框架一起放出,值得研究。 -
不太适合纯对话用户:如果只是日常闲聊、写文案,它的长板你用不上,闭源对话模型体验反而更顺。
值这个价吗
截至 2026 年 8 月 17 日,GLM-5.3 的 API 定价尚未公布,能确定的是权重将在两周内免费开源,GLM Coding Plan 已向全量用户开放并重置了额度。当前的成本结构大致如下:
| 获取方式 | 价格 | 说明 |
|---|---|---|
| 编码平台接入 | 免费 | ZCode、WorkBuddy 等直接切换 |
| GLM Coding Plan | 订阅制 | 额度已重置,可查用量统计 |
| 开源权重 | 免费 | 两周后开放,可本地部署 |
| API | 待公布 | 官方称很快上线 |
从价值角度看,权重免费开源这一点已经把成本优势拉满了。真正的悬念在 API 定价,如果对标同档开源模型的按量计费,它的 Token 效率优势会让单任务成本比闭源低不少。对个人开发者来说,现在就是零成本试用的窗口期。
常见问题
这些是发布三天来被问得最多的问题,一次性说清楚。
Q1:GLM-5.3 开源吗?什么时候能下载权重?
A1:开源,但要等两周。 官方计划发布两周后开放完整权重,此前需要完成安全评估与加固,把潜在攻击能力限制住、保留防御价值。
Q2:现在怎么用上 GLM-5.3?
A2:通过编码平台切换即可。 ZCode、AutoClaw 已上线,TraeWork、WorkBuddy、CodeBuddy、扣子等十余个平台开放抢先体验,登录后在模型列表选 GLM-5.3 就能跑。
Q3:API 上线了吗?价格多少?
A3:还没上线,定价未公布。 官方称 API 很快上线,截至 2026 年 8 月 17 日尚无具体价格,想通过第三方工具接它需要再等等。
Q4:和 GLM-5.2 比强在哪?
A4:编程整体提升 50%,新增安全能力。 基座完全没变,全部增益来自后训练,三大公开基准涨幅都超过四成,网络安全更是从无到有。
Q5:它适合日常聊天吗?
A5:不是它的主战场。 GLM-5.3 的重心是编程与 Agent 任务,日常闲聊、写文案用它有点大材小用,闭源对话模型体验反而更顺。
Q6:网络安全能力会不会被滥用?
A6:官方已做防护。 正是考虑到这一点,智谱才推迟两周开源,先做安全加固,尽量限制攻击能力、保留防御价值,同时建立漏洞披露台账。
Q7:本地部署需要什么配置?
A7:参考 7430 亿参数规模。 完整权重需要较高的显存与算力,量化后门槛会降低,具体配置等权重放出后看官方部署文档为准。
Q8:和 DeepSeek V4 Pro、Kimi K3 比谁强?
A8:各有胜负,安全是独家。 终端操作 GLM-5.3 领先明显,长程软件工程 Kimi K3 略高,DeepSeek V4 Pro 强在 Agent,网络安全则是 GLM-5.3 独占。
Q9:有免费额度吗?
A9:有,且已重置。 8 月 14 日 13:00 起 GLM Coding Plan 全员额度重置,后台用量统计可见额度回满,可直接上手体验。
Q10:适合什么人用?
A10:编程与安全场景最对口。 编程 Agent 重度用户、安全从业者、想私有化部署的企业是核心人群,纯对话用户则不太必要。
所以该入手吗
GLM-5.3 是一次很有说服力的技术表态:不靠堆参数,单靠后训练也能把能力上限抬高一截。对在编程 Agent 上投入大量时间的人,以及安全从业者来说,它是当下开源阵营里几乎不用犹豫的选择。
但如果你只是想要一个日常聊天的模型,或者急着通过 API 做产品集成,现在还不是最佳时机,可以等 API 定价和权重放出之后再决定。
一句话:代码写得多的,现在就该切过去试试,反正免费。

