Qwen3.8-27B 的热度太离谱了,抱抱脸上霸榜了,Top5里面前四都是它的身影

Qwen3.8-27B 之后,我比较期待 Qwen3.8-35B-A3B
因为我拿 Qwen3.8-27B 挑了三个长链条 Skill(测试驱动的 Bug 修复、复杂 Excel 清洗对账、长视频理解)本地执行
它能完成任务老章很高兴,但是它的速度老章不喜欢
还有很多 Qwen3.8-27B 版本我还没来得及玩,比如 NVFP4 + DFlash2 能否大力提速

今晚,千问要开源 Qwen3.8-Flash-Next 了

目前官方能够确认的信息不算多
- Qwen3.8-Flash-Next 是一个多模态 MoE 模型
- 它建立在下一代 Qwen4 架构上
- 今晚 23:00 会同时发布标准版和 FP8 版
2025 年的 Qwen3-Next 先把 Gated DeltaNet、超稀疏 MoE、MTP 等新设计交给社区,后来的 Qwen3.5 也在用这套架构。这次的 Flash-Next,很像 Qwen4 正式登场前的架构先导型号
Qwen3-Next 当时公开的架构,Flash-Next 延续了这条“混合注意力 + 高稀疏 MoE”的效率路线,同时又加入了新的 Qwen Sparse Attention

125B 主干,每次只激活 6B
ModelScope 页面刚上线时短暂出现的一版介绍,页面随后收回了,最终以今晚模型卡为准

当时页面显示:
- 主模型约 125B 参数
- 额外加入约 51B N-gram embeddings
- 每个 Token 激活约 6B 参数
- 使用 GDN Hybrid Layers 和 Qwen Sparse Attention
- 训练成本约为 Qwen3.7-Plus 的 1/9
- 综合能力接近 Qwen3.7-Plus,Coding 和 CoWork 更强
125B 负责装下更多能力,A6B 负责控制每一步的计算量,额外 51B N-gram embeddings 更像一座可查表的记忆库

MoE 会根据当前 Token 选择少量专家参与计算
N-gram embeddings 则把常见短语、代码片段和局部模式做成可检索向量,让主干少花力气重复还原这些高频知识
DeepSeek 的 Engram 和 Google 的 SCONE 研究都在验证类似方向:把更多容量放进条件记忆,通过确定性查找从主机内存取回少量向量,计算量可以保持得很低
Flash-Next 是否采用了完全相同的实现,今晚要看代码和配置文件
6B 激活,依然很吃内存
按照发布前参数做一个最理想的 4bit 粗算(只是猜测,仅供参考):
- 125B 主干约 58.2GiB
- 51B N-gram 表约 23.7GiB
- 两部分合计约 81.9GiB
实际运行还要加量化尺度、KV Cache 和运行时缓冲,估计 Q4 权重文件大概 80~90GB 左右
24GB、32GB 显卡单卡直接跑,基本不用惦记
真正值得关注的是 128GB 统一内存设备、多卡工作站,以及 N-gram 表能否高效放到系统内存甚至 NVMe
如果推理引擎能把查表记忆和主要计算拆开,这种模型会很有意思:显存负责算,系统内存负责记,PCIe 只搬当前命中的少量向量
刚好补上 27B 的短板
27B 稠密模型每一步都要跑完整参数,4bit 能把显存压到 24GB 甜点区,计算量却很难一起消失,速度拉不起来

Flash-Next 走的是另一条路:总参数大幅增加,每步激活量降到约 6B,再给模型外挂一座巨大的 N-gram 记忆库
| 对比项 | Qwen3.8-27B | Qwen3.8-Flash-Next |
|---|---|---|
| 架构 | 27B 稠密多模态 | 多模态 MoE,Qwen4 架构预览 |
| 每步计算 | 完整 27B | 发布前信息约 A6B |
| 存储规模 | BF16 约 56GB | 发布前信息约 125B + 51B N-gram |
| 本地优势 | 量化成熟,24GB 可玩 | 激活量低,潜在吞吐更高 |
| 当前短板 | Skill 长任务速度偏慢 | 内存门槛与运行时支持未知 |
它瞄准的正好是本地 Agent 最难受的地方
Agent、Skills、CoWork 这类任务会不断思考、调用工具、读取结果、修正错误,生成 Token 很多,稠密 27B 的速度很容易把人磨没耐心
Qwen3-Next 当年已经证明混合架构在长上下文吞吐上有巨大潜力
下面两张是之前官方给出的 Prefill 和 Decode 数据,超过 32K 上下文后,Qwen3-Next 相对 Qwen3-32B 的吞吐优势超过 10 倍


Qwen3.8-Flash-Next 能不能把这种效率带到更强的多模态 Agent 上,就是我今晚最想测的东西
Qwen 可能重回开源赛道
我还是怀念 Qwen3.5 那段时光,从 0.8B 到 397B 各种尺寸都有模型可玩

Qwen3.6就只有 27B 和 35B 了,到 Qwen3.7 没有放出任何开源模型
到了 Qwen3.8,节奏突然变了,2.4T 的 Max 级权重开放了,27B 稠密模型开放了,现在连 Qwen4 的架构预览也准备直接交给社区
开源是卡位,不是请客吃饭
Qwen 重新加码开源,图的显然不只是下载量
生意角度,模型被更多人量化、部署、接入工具、写进教程,就能逐渐占领开发者心智,甚至成为事实标准。社区帮它适配硬件、发现问题、验证场景,最终还能把影响力转化为云算力、API、企业私有化和行业服务等商业机会
人民需要 Qwen
本文由作者@Ai学习的老章,授权发布于平台,未经许可禁止转载。

