流式推理优化,让机器人决策延迟低至 0.68 秒

通过复用历史计算,SimpleMemVLA 将 60 秒历史的决策延迟从 1.02 秒降至 0.68 秒,低于实测任务的 0.96 秒实时预算。这套精确流式推理流程与全量重算生成相同的子任务文本,但将共享历史的计算与动作执行重叠起来,减少了决策时的等待。在更长上下文的延迟测试中,约 45 分钟历史对应 245k token,全量重算需要 32.1 秒,而流式决策路径缩短至 1.18 秒。

原文连接