给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让”可交互视频世界”逐渐从概念走向可观看、可操作的原型。若只保留动作与像素,再让视频模型直接学习二者之间的映射,就等于绕过原本存在的程序、规则和显式 world state,转而要求模型从视觉结果中反向拟合整套程序行为。基于这一观察,西湖大学 AGI Lab 与南洋理工大学的研究团队提出了 Code World Model,一种以语言模型为”大脑”的新型世界模型。
给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让”可交互视频世界”逐渐从概念走向可观看、可操作的原型。若只保留动作与像素,再让视频模型直接学习二者之间的映射,就等于绕过原本存在的程序、规则和显式 world state,转而要求模型从视觉结果中反向拟合整套程序行为。基于这一观察,西湖大学 AGI Lab 与南洋理工大学的研究团队提出了 Code World Model,一种以语言模型为”大脑”的新型世界模型。