而 Qwen 的 N-gram Embedding 和 DeepSeek 的 Engram 都是利用当前 token 及其前面若干 token 组成的局部上下文作为 key,通过确定性的哈希函数在一张巨大的嵌入表中查到对应的向量,时间复杂度为 O (1) … Engram 论文通过 Sparsity Allocation 实验发现了一条 U 形缩放定律:在总参数和 FLOPs 固定的前提下,把大约 20%–25% 的稀疏参数预算从 MoE 专家重新分配给 Engram 嵌入表,能获得比纯 MoE 更低的验证损失 … Qwen 的 51B 嵌入参数远超 Engram 论文中验证过的最大规模(Engram-40B 的嵌入参数为 18.5B),这意味着 Qwen 在实践中把 Engram 论文中观察到的”嵌入槽数量与验证损失呈对数线性关系”这一结论推到了更大的尺度。

