NeurIPS’26 | 港科大:从 CPU 到 GPU,AI 能否真正加速全流程?

为评测大模型能否承担这项工作,研究团队提出 AccelEval:从可信的 CPU 程序出发,检验 AI 能否生成结果正确、端到端更快的 GPU 实现。在这种情况下,GPU 加速就不再只是把一个局部计算改写成 CUDA,而是需要先理解整个程序的计算结构:哪些部分可以并行,哪些依赖必须保留,数据应该放在哪里,哪些计算值得融合,以及 CPU 和 GPU 之间如何分工。这些结果说明,自动 CPU-to-GPU 加速已经具有实际潜力,但不能脱离测量条件理解:加速比只统计通过的任务,CPU 对照也是统一的单线程实现,并不是对经过充分调优的多线程 CPU 的普遍优势。

原文连接