DeepSeek V4 适配昇腾:黄仁勋最担心的「去英伟达化」走到哪一步?

到 V4 一代,DeepSeek 首次将英伟达 GPU 和昇腾 NPU 放进同一个硬件框架,在两个平台上分别完成了细粒度专家并行(EP,即把混合专家模型中的不同”专家”子网络分配到不同芯片上并行计算)方案的验证。美国半导体研究机构 SemiAnalysis 6 月发布独立第三方评估,认为 V4 架构”部分是为昇腾推理协同设计的”,并指出在 V4 发布首日,仅有英伟达的 CUDA 和华为的 CANN 两套软件栈提供了完整可用的支持。首日适配还有个值得关注的细节:英伟达自研推理引擎 TensorRT-LLM 的融合内核把隐藏层维度写死为 4096,DeepSeek 此前的模型和 V4-Flash 都符合这一数值,但 V4-Pro 的隐藏层维度却是 7168,因此无法运行。

原文连接