智象(HiDream.ai)将新发布的 HiDream-O1-Video-1.0(简称 HiDream V1)定义为”更懂真实世界的视频生成模型”,并把它放在”一个 UiT(Unified Transformer)、四大模型同源演进”的世界模型路线中。视频模型本身并不是完整的世界模型,一段符合常识的成片也不能证明模型已经形成了可泛化的物理认知。Video 补上的是时间维度:按照智象的世界模型路线,HiDream-O1-Image 用于表达静态空间,HiDream-O1-Video 加入时间、动作与音画变化,HiDream-O1-World 进入可探索的三维环境,HiDream-O1-Embodied 则让模型在现实中行动并接收反馈。

