在 2026 年德国不莱梅 IJCAI 大会的 Early Career Spotlight 环节,亚利桑那州立大学(ASU)助理教授魏华给出了一个极具启发性的”降维”视角:今天大模型智能体所面临的脆弱性,本质上与传统强化学习(RL)在物理世界中遭遇的”仿真到现实(Sim-to-Real)”差距如出一辙。最新的实验证明,通过对智能体的提示词、动作和奖励空间进行随机化扰动,一个仅 30 亿参数(3B)的模型,在应对跨语言等”仿真到现实”难题时,其表现甚至能击败 320 亿参数(32B)的庞然大物。总结而言,我们认为”仿真到现实”的差距广泛存在于机器人学、强化学习、真实世界以及基础模型智能体等大多数决策场景中。

