它没有继续折腾更快的矩阵乘法,而是直接重写了一层 MoE 的执行方式,把 token 调度、跨 GPU 通信和专家计算塞进同一个 GPU 内核。一个拥有 130 TB / s NVLink 带宽的机架,最后仍然需要为 MoE 重写 GPU 内核,原因就在这里:链路已经很快了,接下来要省的是 GPU 等数据的时间。Cursor 重写 GPU 内核的行为,标志着 AI 2.0 时代的竞争进入了”全栈主权”的新阶段。
它没有继续折腾更快的矩阵乘法,而是直接重写了一层 MoE 的执行方式,把 token 调度、跨 GPU 通信和专家计算塞进同一个 GPU 内核。一个拥有 130 TB / s NVLink 带宽的机架,最后仍然需要为 MoE 重写 GPU 内核,原因就在这里:链路已经很快了,接下来要省的是 GPU 等数据的时间。Cursor 重写 GPU 内核的行为,标志着 AI 2.0 时代的竞争进入了”全栈主权”的新阶段。