Qwen3.8-Flash-Next 即将开源,Qwen4 架构!已知情报汇总

Qwen3.8-27B 的热度太离谱了,抱抱脸上霸榜了,Top5里面前四都是它的身影

Qwen3.8-Flash-Next 即将开源,Qwen4 架构!已知情报汇总

Qwen3.8-27B 之后,我比较期待 Qwen3.8-35B-A3B

因为我拿 Qwen3.8-27B 挑了三个长链条 Skill(测试驱动的 Bug 修复、复杂 Excel 清洗对账、长视频理解)本地执行

它能完成任务老章很高兴,但是它的速度老章不喜欢

还有很多 Qwen3.8-27B 版本我还没来得及玩,比如 NVFP4 + DFlash2 能否大力提速

Qwen3.8-Flash-Next 即将开源,Qwen4 架构!已知情报汇总

今晚,千问要开源 Qwen3.8-Flash-Next

Qwen3.8-Flash-Next 即将开源,Qwen4 架构!已知情报汇总

目前官方能够确认的信息不算多

  • Qwen3.8-Flash-Next 是一个多模态 MoE 模型
  • 它建立在下一代 Qwen4 架构上
  • 今晚 23:00 会同时发布标准版和 FP8 版

2025 年的 Qwen3-Next 先把 Gated DeltaNet、超稀疏 MoE、MTP 等新设计交给社区,后来的 Qwen3.5 也在用这套架构。这次的 Flash-Next,很像 Qwen4 正式登场前的架构先导型号

Qwen3-Next 当时公开的架构,Flash-Next 延续了这条“混合注意力 + 高稀疏 MoE”的效率路线,同时又加入了新的 Qwen Sparse Attention

Qwen3-Next 官方混合注意力与超稀疏 MoE 架构

Qwen3-Next 官方混合注意力与超稀疏 MoE 架构

125B 主干,每次只激活 6B

ModelScope 页面刚上线时短暂出现的一版介绍,页面随后收回了,最终以今晚模型卡为准

Qwen3.8-Flash-Next 即将开源,Qwen4 架构!已知情报汇总

当时页面显示:

  • 主模型约 125B 参数
  • 额外加入约 51B N-gram embeddings
  • 每个 Token 激活约 6B 参数
  • 使用 GDN Hybrid Layers 和 Qwen Sparse Attention
  • 训练成本约为 Qwen3.7-Plus 的 1/9
  • 综合能力接近 Qwen3.7-Plus,Coding 和 CoWork 更强

125B 负责装下更多能力,A6B 负责控制每一步的计算量,额外 51B N-gram embeddings 更像一座可查表的记忆库

Qwen3.8-Flash-Next 计算与记忆分层图

Qwen3.8-Flash-Next 计算与记忆分层图

MoE 会根据当前 Token 选择少量专家参与计算

N-gram embeddings 则把常见短语、代码片段和局部模式做成可检索向量,让主干少花力气重复还原这些高频知识

DeepSeek 的 Engram 和 Google 的 SCONE 研究都在验证类似方向:把更多容量放进条件记忆,通过确定性查找从主机内存取回少量向量,计算量可以保持得很低

Flash-Next 是否采用了完全相同的实现,今晚要看代码和配置文件

6B 激活,依然很吃内存

按照发布前参数做一个最理想的 4bit 粗算(只是猜测,仅供参考):

  • 125B 主干约 58.2GiB
  • 51B N-gram 表约 23.7GiB
  • 两部分合计约 81.9GiB

实际运行还要加量化尺度、KV Cache 和运行时缓冲,估计 Q4 权重文件大概 80~90GB 左右

24GB、32GB 显卡单卡直接跑,基本不用惦记

真正值得关注的是 128GB 统一内存设备、多卡工作站,以及 N-gram 表能否高效放到系统内存甚至 NVMe

如果推理引擎能把查表记忆和主要计算拆开,这种模型会很有意思:显存负责算,系统内存负责记,PCIe 只搬当前命中的少量向量

刚好补上 27B 的短板

27B 稠密模型每一步都要跑完整参数,4bit 能把显存压到 24GB 甜点区,计算量却很难一起消失,速度拉不起来

Qwen3.8-27B 稠密架构与本地部署定位

Qwen3.8-27B 稠密架构与本地部署定位

Flash-Next 走的是另一条路:总参数大幅增加,每步激活量降到约 6B,再给模型外挂一座巨大的 N-gram 记忆库

对比项 Qwen3.8-27B Qwen3.8-Flash-Next
架构 27B 稠密多模态 多模态 MoE,Qwen4 架构预览
每步计算 完整 27B 发布前信息约 A6B
存储规模 BF16 约 56GB 发布前信息约 125B + 51B N-gram
本地优势 量化成熟,24GB 可玩 激活量低,潜在吞吐更高
当前短板 Skill 长任务速度偏慢 内存门槛与运行时支持未知

它瞄准的正好是本地 Agent 最难受的地方

Agent、Skills、CoWork 这类任务会不断思考、调用工具、读取结果、修正错误,生成 Token 很多,稠密 27B 的速度很容易把人磨没耐心

Qwen3-Next 当年已经证明混合架构在长上下文吞吐上有巨大潜力

下面两张是之前官方给出的 Prefill 和 Decode 数据,超过 32K 上下文后,Qwen3-Next 相对 Qwen3-32B 的吞吐优势超过 10 倍

Qwen3-Next 官方 Prefill 吞吐对比

Qwen3-Next 官方 Prefill 吞吐对比

Qwen3-Next 官方 Decode 吞吐对比

Qwen3-Next 官方 Decode 吞吐对比

Qwen3.8-Flash-Next 能不能把这种效率带到更强的多模态 Agent 上,就是我今晚最想测的东西

Qwen 可能重回开源赛道

我还是怀念 Qwen3.5 那段时光,从 0.8B 到 397B 各种尺寸都有模型可玩

Qwen3.8-Flash-Next 即将开源,Qwen4 架构!已知情报汇总

Qwen3.6就只有 27B 和 35B 了,到 Qwen3.7 没有放出任何开源模型

到了 Qwen3.8,节奏突然变了,2.4T 的 Max 级权重开放了,27B 稠密模型开放了,现在连 Qwen4 的架构预览也准备直接交给社区

开源是卡位,不是请客吃饭

Qwen 重新加码开源,图的显然不只是下载量

生意角度,模型被更多人量化、部署、接入工具、写进教程,就能逐渐占领开发者心智,甚至成为事实标准。社区帮它适配硬件、发现问题、验证场景,最终还能把影响力转化为云算力、API、企业私有化和行业服务等商业机会

人民需要 Qwen

本文由作者@Ai学习的老章,授权发布于平台,未经许可禁止转载。

AI情报

大厂都在教人一句话做APP,Rome却让AI给自己开发应用

2026-8-26 13:36:15

实战分享

实战从零开始构建一个Coding Agent:Violin

2026-8-5 18:30:00

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧