Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?

GLM-5.3-Flash 项目配置文件显示:45 层架构中,34 层采用 Kimi 路线的 KDA 线性注意力,另外 11 层采用 DeepSeek 路线的 KPool-DSA 稀疏注意力。今年以来,大模型架构里出现了一条越来越清晰的变化:一些混合注意力架构中原本由全局 Attention 承担的角色,开始被 Sparse Attention(稀疏注意力)接替。从不同 Attention 路线,看大模型公司的选择。到了今年,很多混合注意力架构里由全局 Attention 承担的角色,开始出现被 Sparse Attention 接替的迹象。再回到开头那张架构图,Kimi 和 DeepSeek 的名字同时出现在 GLM-5.3-Flash 里,已经没有那么反常了。

原文连接