预填充吞吐超 330 Token / s:高通携手阶跃等为第六代骁龙 8 超级至尊版端侧适配 300 亿参数 AI 模型

夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,高通宣布携手阶跃、无量火及江波龙,基于第六代骁龙 8 超级至尊版移动平台,端侧适配与推理优化阶跃 StepEdge-Omni 30B-MoE 模型,并现场演示相关智能体助手 … 模型预填充吞吐性能超过每秒 330 个 Token,解码吞吐性能超过每秒 28 个 Token … 模型预填充吞吐性能是指大语言模型在推理的预填充(prefill)阶段,每秒能够处理的输入词元(token)数量,是衡量系统处理长提示词(prompt)和批量请求能力的关键指标。

原文连接