横扫四榜,DM0.5 凭什么面面俱到?

指令跟随方面,DM0.5 在预训练阶段设计了具身思维链:动作生成之前,模型要先走完一套内部推理流程 —— 目标物体在哪、上一步干了什么、这步该不该结束、不这么干会怎样……DM0.5 在 RoboColiseum 上的路径是:强大的预训练底座,没有针对评测任务做专项优化,只是通过常规监督微调将模型能力迁移到了 RoboColiseum 的机器人构型和任务上,完成从底座到榜单任务的适配…… 跨越仿真与真机、覆盖操作与导航、兼容单一机型与多种异构构型,这些数字共同指向同一个结论:DM0.5 的成绩并非依赖某一个场景或评测框架的特殊适配,而是在多个独立的考场上反复被验证过的。

原文连接