早上在群里刷到个截图,看得我有点乐😂
这是V2EX上一个帖子,标题叫《我们开始倒班考勤了》。

发帖人说因为几家大模型都开始搞高峰期token翻倍,公司为了省token成本,本周起改考勤:非周末休息一天,周末再休息一天,可自由组合,但要提前排班;工作日午休也推到14点以后。
也真不知道该说他们公司足够AI Native还是特么太抠门呢。不过,现在智能的价格确实还不够便宜,至少DeepSeek的几次价格调整,确实会让很多人有很明显的账单价格变化的体感。然后,还好,国内几家头部大厂和大模型公司够卷的,我们很快等来了更好的模型和更低的价格。
Qwen3.8-Flash来了
昨晚阿里发了Qwen3.8-Flash,我把两家的价目表拉到一起看了一遍。

Qwen3.8-Flash上线千问AI平台的API价格是每百万token输入0.8元、输出2.7元,缓存命中0.1元,一口价,官方原文通篇没有峰谷、没有忙时闲时、没有阶梯。DeepSeek这边V4-Flash的输出是空闲4.5元、高峰9元,V4-Pro空闲13.5元、高峰27元,高峰时段是周一到周五的9点到12点、14点到18点,其余时间价格减半。
顺手换算一下量级——一亿token的输入,走Qwen3.8-Flash是80块;同样的量走Claude Opus 4.6的API,是500美元。3.8-Flash命中缓存只要10块,算是同类模型中的最低价格了。
现在X上很喜欢管这叫「斩杀线」。Qwen3.8-Flash确实把这条线又往下推了一格。

不过便宜归便宜,性能到底行不行?
那性能呢
8月26日晚上发布的是Qwen3.8-Flash,同步开源了权重版Qwen3.8-Flash-Next(同一个模型,Next指的是下一代架构)。官方放了两张对比表,对照组是自家的Qwen3.8-27B、上一代Qwen3.7-Plus,加上DeepSeek-V4-Flash和Claude Opus 4.6。
|
|
|
挑几个我觉得你会关心的:智能体编程的SWE-bench Pro,62.5比53.4,领先Opus 4.6九分;专业工作任务JobBench,55.7比36.6,差了19分;模拟手机操作的AndroidWorld,84.5比62.0,差22.5分;用视觉推理解数学题的MathVision差25.1分;具身智能ERQA差31.5分。长程任务CoWorkBench和真实工具调用Toolathlon这两项比的是DeepSeek-V4-Flash,也都赢了(Toolathlon只领先3.2分,幅度不大)。
不过我觉得更有趣的还不是这些分数,是表头那一行写的参数量:Qwen3.8-Flash-Next是125B总参数、6B激活,DeepSeek-V4-Flash是284B总参数、13B激活,自家上一代Qwen3.7-Plus是397B总参数、17B激活。
总参数不到DeepSeek那个的一半,每次干活只激活60亿参数,大概是它自己总参数的二十分之一。分数、价格、参数量这三件事放一起看,才是这次发布真正想说的那件事。
我拿它跑了一晚上真活
跑分这东西你我大概都知道是怎么回事,所以昨晚23点API一开放(发布文里写的还是「即将上线」),我直接把它接进Claude Code,甩了三个真活过去。

第一个是数据分析。
我让接了Qwen3.8-Flash 的cc调用Huashu-Excel skill去分析一份真实数据,B站「每周必看」榜单,要求评估:什么样的视频能上榜、互动数据有什么规律、该押哪些区。数据里我埋了坑,期数大量缺失、互动极端右偏、官方口径中途变过一次。

它干了一个半小时,190次工具调用,HTML、docx、xlsx、deck四种格式全交付了。但最值得说的是它开工后干的头一件事——它发现任务书和数据文件对不上:任务书写5,324行×32列,实际是7,427行×33列。它没装没看见,把两份数字摆在一起声明以文件为准,又去核了官方接口确认口径。从数据清洗、处理到最后的分析和呈现,基本上完全符合我这个数据分析skill的设定和预期,我甚至很难看出它和我平时用的Opus5的表现有什么差异。
第二个是让它给自己画张架构图。
我的要求很简单:你的新架构今晚要公布,用一张图把GDN+QSA混合注意力、门控残差、N-gram Embedding、Muon优化器这四件事讲清楚,讲给一个懂AI但没空看论文的人听。

15分31秒,32次工具调用,交回来一个29KB的单文件网页,参数构成条能点,四个技术点各一张可折叠卡片。那32次里有7次是它自己截图自检——发现画的SVG有个标签戳出边框,改完再截一张确认干净才说交付。
图里的关键数字我抽查了几个拿去跟技术报告对,全部命中,没有编。
一个半小时和15分钟。从变现来说,这个模型在真实任务里已经非常接近一个靠谱的分析师和研究员了。
第三个活我放到后面讲,它跑出来的东西正好是后面那节的论据。
它凭什么这么便宜

这个价格是从架构上把成本结构整个重算了一遍得来的,改了四个地方。
注意力换成GDN+QSA的混合架构,48层网络里每4层是3个GDN加1个QSA,GDN负责把历史信息持续压缩进一个固定大小的状态,QSA那一层保留全局注意力做精确检索(官方的说法是「GDN负责高效记住,QSA负责精准查找」)。数字是有的:1M token的超长上下文下,注意力计算核心在Prefill和Decode阶段分别提速最高7.6倍和4.9倍;在贴近线上真实场景的90%缓存命中设定下,1M上下文的Prefill吞吐是Qwen3.7-Plus的8.6倍。
残差连接从传统Transformer的一条主通道拆成四条,加了动态门控决定每条通道读写什么。这个我理解起来最费劲,大概意思是模型内部传信息的车道变多了,还能自己挑道走,训练的时候也更稳。
Embedding外挂了51B参数的N-gram Embedding,2000万条bigram和trigram挂在第2层,走的是查表逻辑不参与实际计算,所以可以卸载到主机内存里,不占GPU显存。
优化器换成Muon,纯训练侧的改动,跟你用起来的体感没关系,但决定了训练成本能不能真降下来。技术报告里有个数字我觉得比「降本九成」更能说明问题:全量训练没有出现过一次loss尖峰,也没有梯度范数的异常波动,而且没依赖qk-clip、SwiGLU-clip这类显式裁剪手段。训练这个量级的模型,loss突然飙起来然后回滚checkpoint重来是很常有的事,每一次都是真金白银烧出去,一次都没崩,这本身就是成本控制的一部分。
四件事拼起来的结果,技术报告里算得很清楚:相比397B的上一代旗舰,这次用了1/3的激活参数、1/3的训练token、大约1/9的训练算力。所谓训练成本降九成,指的就是这个1/9。
还有个细节挺有意思,他们测自己模型的编程能力,用的评测框架是Claude Code,SWE-bench Pro那几项的脚注写得明明白白,其中一项的裁判还是GPT-5.4。拿对手的工具和对手的模型来给自己判卷,倒是挺敢的。
便宜这件事,正在从算术题变成心智题
到这我们已经知道它便宜、快、够强了。但性价比这道题该换个问法:agent时代一次任务背后是几十上百次调用,上面那个数据分析就调了190次工具,真正该问的是跑完整套流程一共花多少钱、多少时间。
还有一件不太容易被塞进价格表的事——一口价意味着你不用在心里装一张时刻表,不用为了省钱把工作节奏往凌晨挪。当然一口价不是承诺,是一个状态:DeepSeek从一口价改成峰谷只隔了十几天。这份价目表能在墙上贴多久,取决于训练成本降九成、6B激活这些东西撑不撑得住;真涨价了权重是开源的,换门也就是改一行配置。
昨晚发Flash的不止阿里。智谱同一晚也甩出了GLM-5.3-Flash(代号「牛来」),Artificial Analysis智能指数57分、跟Claude Opus 4.8打平,价格也压得很狠。挺能打,测评还没出来,我把参数摆一起就有点数了——GLM-5.3-Flash是320B总参、18B激活,Qwen3.8-Flash是125B/6B,总参数是它的两倍半,每吐一个token要动的参数是它的整整三倍。价钱几乎打平,可它背后烧的算力是阿里的好几倍,这更像是亏本赚吆喝。再想想智谱这次是靠十万张国产卡扛起来的,算力本就不算宽裕。低价能挂出来是一回事,能不能让所有人敞开了、天天用又是另一回事。阿里这边不一样,算力是它的老本行——所以这个价这能让量大管饱用起来。
说到开源,我那第三个活正好就是干这个的。
我让它写一份关于Qwen在开源世界影响力的深度研究报告。注意这个设定:让Qwen自己写一份关于Qwen的报告。用的skill是我最近在攒的huashu-report。

它跑了三个小时,中间自己起了十几个subagent分头调研,交回来一份36页的研报:33张Exhibit连续编号,62条核心数据每条都标了口径、样本量、出处和时点,底下压着258条一手采集记录。写完自己又派了两路独立审校agent核事实和文风。
密度和排版是投行研报那个样子的,看图就知道了。
三个活放一起,我的判断是:这个模型在办公、数据分析、研究报告这类任务上,只要给它一个像样的harness,再配一套趁手的skill,表现已经是顶级的了。
它算出来的数字里有一条正好用在这儿:阿里的闭源旗舰Qwen3.8-Max和开源版Qwen3.8-2.4T-A95B,在Artificial Analysis的智能指数上是一模一样的58分——美国最强闭源和最强开源差21分。还有个小细节:这个模型在HuggingFace上的架构标识符直接就叫qwen4_exp,所谓「Qwen4架构的提前预演」,代码里就是这么写的。
你现在能在哪些地方用上它
写到这该落地了。目前有四个入口,按门槛从低到高排:
一、千问办公。这是绝大多数人真正会接触到这个模型的方式,今早我一打开就弹了这个:

不用申请key,不用配环境,你甚至感觉不到自己在用哪个模型,想做份周报或者一版PPT,它就给你做出来了,而且挺快。前面聊的架构、跑分、每百万token多少钱,落到普通用户这里就剩这一句。
二、千问AI平台的API。生产版Qwen3.8-Flash跑在这上面,默认1M上下文,带官方的内置工具调用。
三、阿里云百炼。模型广场已经上架了Qwen3.8-Flash的卡片。这条路我要多说两句,因为它同时兼容OpenAI和Anthropic两套接口协议,意味着Claude Code、Codex这类agent工具直接就能接,官方描述里就写了这句,不是野路子。我昨晚这篇文章里所有的实测,就是拿Claude Code接上它跑的,190次工具调用、改文件、跑脚本、截图自检,整套工作流跟平时用Claude Code没任何区别,配置里把base URL和model换掉就行。这一点对我这种把agent工具当日常主力的人来说很重要,换模型的成本如果只是改一行配置,那「要不要试试新模型」这个决定就变得很轻,不用先在心里做一轮成本评估。
四、自己部署。Qwen3.8-Flash-Next的开放权重已经发在HuggingFace和魔搭社区,可以下载、微调、量化、二次开发。125B的模型你在自己电脑上大概率是跑不动的,但如果你在企业里做私有化部署,或者想在这个新架构上做点研究,这条路是通的。
最后
再回到那个倒班的帖子。
我不觉得便宜就意味着谁取代谁,真到了最难的那一档任务,该用贵的还是得用贵的,我自己也一样。但一个更现实的问题摆出来了:当大量日常的agent任务已经能被便宜模型高质量地完成,你还会让贵模型去承担所有请求吗?还会为了省这笔钱,去改一整个团队的作息吗?
本文由作者@花叔,授权发布于平台,未经许可禁止转载。



