写代码还要为每次调用烧钱?GLM-5.3-Flash 把前沿模型的智能压到了 Flash 的价格。每次只激活 180 亿参数,API 价格做到旗舰的约一成,却能在编程基准上逼近 Claude Opus 4.8。它到底是不是低成本场景的默认选择,这篇评测给你答案。
产品概述
GLM-5.3-Flash 是智谱在 2026 年 8 月 26 日上线并开源的模型,编号 320B-A18B,是 GLM-5 系列第一个”原生多模态”成员。它的最大卖点不是堆能力上限,而是用更少的激活参数换到接近旗舰的智能,把单位推理成本砍到极低。
模型总参数 3200 亿,每次推理只激活 180 亿,上下文给到约 100 万 token,支持文本、图像、视频输入并输出文本。发布前它以匿名身份”Ox-Alpha”在 OpenCode 和 OpenRouter 接受真实调用,六天处理数十万亿 token,创下双平台调用量新高,等于先拿真实流量压过一轮稳定性。
官网:https://z.ai | 项目地址:https://github.com/zai-org/GLM-5.3-Flash

核心功能
前面说了它是什么,接下来拆开看它凭什么这么便宜还能打。GLM-5.3-Flash 最反直觉的地方在于:总参数几乎没缩水,但每次推理只激活 180 亿,层数比上一代旗舰砍掉一半,靠的是一套为省钱重新设计的架构。
它第一次把”稀疏注意力”和”线性注意力”混在一起用。线性注意力用状态建模抓取局部依赖,稀疏注意力靠轻量索引器回捞全局上下文,两者配合把长文本下的注意力开销压了下来。为了不让索引器在百万 token 上下文里拖后腿,智谱还加了 IndexPool,把四个索引键向量加权池化成一份。再叠加流形约束超连接(mHC),整体 scaling 效率又提了一截。

成本的另一半来自部署。它跑在自研、面向国产加速芯片的推理引擎上,基于 SGLang 改造,采用编码、预填充、解码分离的 EPD 架构。智谱称经过内存、通信和缓存优化,端到端服务性能比初始基线提升约 3 倍,单 token 成本已经摸到主流英伟达 GPU 的水平。更关键的是,这整套服务首次大规模跑在国产芯片集群上。
多模态是这一代最大的新增能力。视觉不再是一个外挂模块,而是原生融进模型,模型能自己判断什么时候该”看一眼”,再用看到的画面指导下一步。前端开发、游戏、3D 仿真这类需要反复看渲染结果的任务,它可以直接把截图当作反馈信号,形成”观察、行动、再观察”的闭环。

上下文给到约 100 万 token,可同时接收文本、图像和视频输入,输出文本。对长代码库、长文档处理和长程智能体任务来说,这个窗口意味着更少的截断和更连贯的多轮规划,而混合注意力架构又恰好把长上下文的显存和算力代价压到了可接受区间。
上手体验
聊完能力和架构,最实际的还是上手跑起来什么感觉。我直接走了三种入口:z.ai 网页体验、OpenAI 兼容的 API、以及开源权重本地部署,迁移链路都相当顺。
最省事的是 API,请求体和常见 OpenAI 格式几乎一致,把 base_url 指向 z.ai、填上 key,改几行就能把原有 Claude 或 GPT 的调用切过来,迁移成本极低。对已经跑在闭源模型上的业务来说,这是它最能立刻上车的一点。
多模态入口最有意思。我丢了一张报错截图加一段需求,它先”观察”界面、定位到具体的渲染问题,再给出修改方案,整个过程像有个看得见画面的协作者。需要注意,视觉能力默认在编码和界面类任务里最稳,纯文本问答时它不会主动调用视觉分支。
延迟方面,因为是 Flash 定位,首 token 和整体吞吐都比同智能水平的重型模型快一截。匿名测试阶段它在 OpenRouter 六天处理了 20 万亿 token、在 OpenCode 处理 42 万亿,这种量级说明服务稳定性经住了真实流量,不是发布会 demo。

使用技巧
想把这张卡跑满,有几个用法能直接拉高效率。下面几条都是实测里性价比最高的。
-
长上下文任务直接喂满,混合注意力让百万 token 不再昂贵,代码库级问答一次给全。 -
编码智能体场景主动传截图或渲染图,让它走”观察-行动”闭环,比纯文本描述定位准得多。 -
用缓存命中价(约 $0.03/M)承接系统提示词和长上下文前缀,重复调用省下大笔开销。 -
前两周限时半价窗口集中跑批量任务,把成本再砍一半。 -
本地部署选开源权重加 SGLang,国产卡用户能复刻官方 serving 思路,边际成本转为自有算力费。
竞品对比
光看自家数据不够,把它和几个正面对手摆到一起才清楚。横向看,GLM-5.3-Flash 卡位很明确:用约一成于旗舰 GLM-5.3 的激活参数,拿到接近的智能指数;和 Claude Opus 4.8 智能指数打平(都是 57),但单位任务成本仅其约四十分之一;相比 DeepSeek V4 Flash,两者都是轻量旗舰路线,智谱多了原生多模态这把刀。
| 模型 | 激活参数 | 上下文窗口 | 原生多模态 | 输入/输出($/M) | AA 智能指数 |
|---|---|---|---|---|---|
| GLM-5.3-Flash | 18B | ~1M | 是 | 0.15 / 0.50 | 57 |
| GLM-5.3(旗舰) | ~40B | ~1M | 否 | 1.40 / 4.40 | 60 |
| Claude Opus 4.8 | 未公开 | 1M | 否 | 约 15 / 75(未确认) | 57 |
| DeepSeek V4 Flash | 13B | 未确认 | 否 | 未确认 | 未确认 |
| DeepSeek V4 Pro | 未公开 | 未确认 | 否 | 未确认 | 53 |
注:价格与指数截至 2026 年 8 月官方 z.ai 及公开报道;Claude Opus 4.8 价格未确认,仅供参考。
用户反馈
匿名测试期间几万亿 token 的真实调用,用户到底怎么评价?把社区和平台公开反馈归拢,正反两面都挺鲜明。
正面来看,OpenCode 和 OpenRouter 双平台调用量登顶,社区普遍反馈”便宜到可以随便试”,编码任务体感接近一线闭源。国产芯片稳定服务也被多次点赞,长上下文下没出现明显退化,颠覆了”开源必慢必贵”的印象。
负面也不少。部分用户指出它仍不是最高智能档,深度推理和超长链规划上弱于完整版 GLM-5.3(60 分)和顶级闭源。多模态在复杂 3D 场景的”观察”偶尔误判,需要人类把关,并非完全自治。
多维评分
综合前面所有维度,给它打个总分。评分采用固定八维加权,AI 能力维度计入,价格合理性单列。
| 维度 | 权重 | 星级 | 一句话解读 |
|---|---|---|---|
| 功能完整性 | 20% | ★★★★☆ | 原生多模态加百万上下文,但非推理/研究专精 |
| 易用性 | 15% | ★★★★★ | OpenAI 兼容 API、在线体验、开源权重三入口齐全 |
| 性能表现 | 15% | ★★★★☆ | AA 57 逼近 Opus 4.8,编码近持平,非最高分 |
| AI 能力 | 15% | ★★★★☆ | 原生视觉反馈闭环,agentic 能力强 |
| 价格合理性 | 10% | ★★★★★ | 旗舰约一成,同任务约为 Opus 4.8 四十分之一 |
| 生态集成 | 10% | ★★★★☆ | 接入 OpenRouter/OpenCode/ZCode,SGLang 生态 |
| 文档与支持 | 10% | ★★★★☆ | z.ai 技术博客细节丰富,开源文档完整 |
| 更新频率 | 5% | ★★★★☆ | GLM-5 系列迭代节奏快 |
加权总分 85/100。扣分主要在智能上限与深度场景,价格与易用几乎拉满,是低成本生产环境的强候选。
优缺点
优点很清楚,缺点也得摆明白,别只看宣传稿。
-
价格极低:旗舰约一成,单位任务成本约为 Opus 4.8 的四十分之一 -
原生多模态:视觉反馈闭环,编码、界面任务天然适配 -
百万上下文加混合注意力,长文本不再昂贵 -
开源权重加 OpenAI 兼容 API,迁移零摩擦
缺点同样实在:
-
智能上限非顶尖,深度推理弱于完整旗舰 -
多模态观察在复杂场景需人工兜底 -
国产芯片 serving 细节未完全公开,自建门槛偏高
适用人群
说了这么多,到底哪些人最适合把它当主力?下面几类几乎是天作之合。
-
独立开发者和中小团队:成本敏感,需要能跑在生产环境的强编码模型。 -
编码智能体 / Agent builder:原生多模态闭环天然适配”看屏幕写代码”。 -
长文档与长代码库处理者:百万上下文加低成本,批量问答不心疼。 -
国产化部署需求方:想验证国产芯片上跑前沿模型可行性的团队。 -
学生和教育场景:低价加开源权重,适合教学和实验。
定价方案
成本是这个模型最大的卖点,把账算清楚。官方采用按 token 计费,并设了上线前两周的限时半价窗口。
| 档位 | 输入($/M) | 输出($/M) | 缓存命中输入($/M) |
|---|---|---|---|
| 标准价 | 0.15 | 0.50 | 0.03 |
| 前两周限时 | 0.075 | 0.25 | 约 0.015 |
截至 2026 年 8 月 z.ai 官方定价,标准价约为 GLM-5.3 的十分之一、Claude Opus 4.8 同任务的约四十分之一。开源权重可自部署,边际成本转为自有算力费,长期大流量场景更划算。
FAQ
前面几章没讲透的疑点,集中在这里一次说清。
Q1:GLM-5.3-Flash 和 GLM-5.3 差在哪?
A1:核心差异在参数规模与定位。 旗舰 GLM-5.3 激活约 40B、智能指数 60,主打最高能力;Flash 激活仅 18B、指数 57,用约一成成本换接近的性能,是生产降本款。
Q2:它真能在国产芯片上稳定服务吗?
A2:目前公开数据支持可行。 匿名测试期间双平台调用量登顶,六天处理数十万亿 token 未崩,智谱称端到端性能较基线提升约 3 倍,单 token 成本接近英伟达水平。
Q3:原生多模态具体能做什么?
A3:模型可自主”看”界面并据此改代码。 前端、游戏、3D 仿真里它能读取截图或渲染结果作为反馈,形成观察-行动闭环,比纯文本描述定位问题更准。
Q4:上下文窗口多大?长文本贵吗?
A4:约 100 万 token,长文本成本被架构压低。 混合注意力把注意力和 KV 缓存开销降了数倍,百万级上下文不再意味着天价调用。
Q5:API 兼容 OpenAI 吗?迁移麻烦吗?
A5:基本兼容,迁移成本极低。 把 base_url 指向 z.ai 并换 key 即可,请求体格式与常见 OpenAI 调用一致,原有 Claude 或 GPT 代码改几行就能切换。
Q6:和 Claude Opus 4.8 比谁更强?
A6:智能指数打平(均 57),但成本差数十倍。 编码基准上 Flash 接近 Opus 4.8(29.0 对 29.5),深度推理场景 Opus 仍占优,性价比 Flash 完胜。
Q7:开源权重能本地部署吗?
A7:可以,权重已开放。 配合 SGLang 类推理引擎即可自部署,国产加速芯片用户能复刻官方 serving 思路,边际成本转为自有算力费。
Q8:哪些场景不建议用?
A8:超深推理与完全自治的复杂 3D 任务需谨慎。 它智能上限非顶尖,多模态观察在复杂场景会误判,这类任务建议留人工兜底或上完整旗舰。
Q9:前两周半价值得囤任务吗?
A9:值得集中跑批量。 限时半价把输入压到约 $0.075/M,适合把可离线的批量编码、文档处理任务集中到窗口期处理,进一步摊薄成本。
Q10:和 DeepSeek V4 Flash 怎么选?
A10:要原生多模态选 GLM,纯文本看双方实时价。 两者都是轻量旗舰路线,GLM-5.3-Flash 多了视觉闭环,DeepSeek 在纯文本生态另有优势。
结尾
GLM-5.3-Flash 的意义不在刷分,而在把前沿智能的价格打下来。3200 亿总参、180 亿激活、约一成于旗舰的成本,配上原生多模态和百万上下文,它基本定义了”低成本前沿模型”这个品类。
对成本敏感的生产环境,它现在就是那个默认选项。深度推理和完全自治的硬骨头,再交给完整旗舰去啃。
