[CVPR 2026] PlayWorld: 让机器人通过“自主玩耍”练就物理直觉,打破视频模型幻觉
PlayWorld: Learning Robot World Models from Autonomous Play
本文提出了 PlayWorld,一个通过机器人自主“对玩”(Autonomous Play)来训练动作条件视频世界模型(Video World Models)的框架。该方法利用 VLM 自动生成任务指令并驱动 VLA 执行,从而在无需人类标注的情况下,构建出比传统专家演示数据物理一致性更高、接触动力学更丰富的通用机器人模拟器。
TL;DR
普林斯顿大学的研究团队推出 PlayWorld,这是一个全自动的机器人世界模型训练流水线。不同于以往依赖人类专家演示(Success-biased)的方法,PlayWorld 让机器人通过“自主对玩”收集海量长尾物理交互数据。实验证明,该模型不仅能精准预测碰撞、滑动、形变等复杂动力学,还能在“想象”中对机器人策略进行 RL 微调,使真实世界成功率暴涨 65%。
背景定位:世界模型为何在接触中“翻车”?
在 AI 机器人领域,基于生成式视频的模型一直被寄予厚望,希望它们能成为“数据驱动的物理模拟器”。然而,目前的 SOTA 模型(如 SVD, Sora 类架构)在处理**接触密集型(Contact-rich)**交互时常常露馅:物体被抓取时会突然变大,或者在碰撞后莫名消失。
本质痛点:数据偏差。现有的训练集(如 DROID, Open X-Embodiment)大多是人类录制的成功演示。模型只见过“正确的路”,没见过“摔倒的瞬间”。当策略在推理中执行了一步稍微偏离的操作时,世界模型因从未见过这种分布外(OOD)的状态,只能产生错误的幻觉。
核心动机:像婴儿一样通过“玩耍”学习
PlayWorld 的核心直觉源于发展心理学:人类婴儿通过无目的的玩耍来理解世界物理规则。作者提出,机器人也应该通过自主生成的、半结构化的交互(Play Data)来拓宽其对物理世界的认知,而不是只学习专家路径。
方法论详解:从指令生成到课程学习
1. 自主数据采集流水线
PlayWorld 构建了一个闭环系统:
- Task Proposer (VLM):根据摄像头的实时图像,提出探索性指令(如“把胡萝卜推向碗边”、“尝试垂直翻转方块”)。
- Task Executer (VLA):执行指令并产生轨迹。
- Safety Filter:确保机器人在无人看管下(如深夜自主运行 8 小时)不会撞坏硬件,并能在物体移出范围时自动重置场景。

2. 课程学习 (Curriculum Learning)
面对海量的、冗余度极高的自主 play 数据,作者设计了一种基于“难易度”的课程:
- 使用 CLIP 提取特征,计算 Play 数据与专家成功轨迹之间的距离。
- 训练初期侧重于常见的空载运动,后期逐渐转向高难度的接触交互(Long-tail events),防止模型在简单的背景运动中过拟合。
实验战绩:让“想象”照进现实
1. 物理一致性的飞跃
在包含碰撞、滑动、滑动(Slip)和形变的 Interaction-centric 评测中,PlayWorld 的预测结果在 LPIPS 和 SSIM 指标上全面领先。

2. 真实世界的 RL 闭环
这是本论文最惊艳的部分。作者利用 PlayWorld 作为模拟器,在其中运行强化学习算法(DSRL)。
- 结果:原本在真机上表现平平的 Policy(只有不到 30% 成功率),经过在 PlayWorld 里的虚拟微调,回到真实世界后,成功率提升了 65%。这证明了 PlayWorld 的动力学预测由于足够真实,已经具备了支持“在想象中学习”的能力。

深度洞察与总结
关键启示 (Takeaway)
- 数据分布的重要性大于架构优化:只要数据覆盖了足够的“错误”和“异常”交互,基础的视频扩散模型也能展现出极强的物理推理能力。
- 自主化是通往 Generalist 的唯一路径:人类演示不可扩展,只有让机器人 24/7 自动“对玩”,才能获取训练通用物理大脑所需的千亿级交互样本。
局限性与展望
尽管 PlayWorld 极大缓解了幻觉问题,但在极长程(Long-horizon)的预测中仍存在累计误差。未来的研究方向可能包括更复杂的反事实推理,以及将该框架扩展到更多样化的机器人形态(如双足或人形机器人)中。
本文由资深学术主编重构。原文作者:Tenny Yin, Anirudha Majumdar et al. (Princeton University)
