「一套模型正向仿真逆向规划」现有的视频世界模型做机器人仿真输入动作的方式无非两种传关节角、末端位姿这种低维向量Ctrl-World 路线或者传骨架热力图、末端轨迹这些稀疏视觉信号。两条路各有一堆拥趸但也各有一堆没法绕过的坑低维向量换一个机器人本体就崩骨架热力图在遮挡场景里直接失效。更致命的是正向仿真输入动作预测结果和逆向规划输入目标反推动作必须分成两套独立模型训练——数据和算力翻倍工程复杂度直接劝退大部分团队。斯坦福、马里兰大学、哈佛联合团队含李飞飞、吴佳俊等的这篇 Masked Visual Actions用一个极其简洁的思路把这个问题翻了个面别传数字了直接把动作画进画面里。01 核心想法动作即掩码这个思路的出发点其实非常朴素——预训练视频大模型在像素空间里的理解和补全能力已经很强了为什么非要逼它去理解关节角向量Masked Visual Actions 的做法是把机器人或目标物体在每一帧里占据的像素区域完整保留其余画面全部用灰色遮住。视频模型要做的就是把灰色区域里的内容补全——该动的物体让它动该静止的背景让它静止。这样一来动作输入和视频模型的原生视觉表征完全对齐。没有编码器没有数值向量到视觉信号的翻译层没有任何新模块——就是把动作变成了视频模型本来就会处理的掩码补全任务。图 | 掩码视觉动作整体框架总览图02 两种掩码打通真实数据和自定义动作训练数据怎么来论文给了两条互补的流水线分割式掩码用 SAM 直接从真实机器人视频里把机械臂抠出来。不需要相机参数不需要机器人模型手里有任何实拍视频就能用。代价是测试时只能复现视频里出现过的动作。渲染式掩码读机器人关节状态通过 URDF 模型和相机标定渲染出半透明的机械臂掩码夹爪标红方便识别。这条线的价值在于——推理时你可以自由生成从未在训练数据中出现过的机器人动作掩码。跨本体的泛化能力核心就靠它。训练数据融合了 DROID 真实机械手视频和 Robocasa 仿真场景同时纳入了成功和失败两种交互轨迹。模型见过机器人抓东西抓到也见过机器人抓空——反事实的数据让它学到的不只是这样动会怎样也包括这样动不行。图 | 模型正向、逆向两大应用逻辑示意图图 | 掩码数据集两种构建方案分割法 渲染法03 训练有多轻15小时数据4天微调整套方案基于 Wan-Fun-Control 2.2 14B 视频底座不做任何主干改动。LoRA rank256 微调8 张 H200 跑了 4 天、1 万步。训练数据加起来只有 15 小时——对比动辄上百小时的机器人训练数据集数据效率不是一个量级。关键在于掩码缺失区域统一填灰色通过通道拼接做条件输入。整个工程链路不需要新增编码器、不需要改模型结构、不需要特殊 tokenizer。改造成本几乎为零。更值得强调的是推理时的双向能力正向掩码锁定机器人模型根据参考帧补全物体运动轨迹——我这样动杯子会怎样逆向掩码锁定目标物体模型补全机器人运动——杯子要移到那边我的手该怎么动逆向能力零样本触发。训练时只用了机器人掩码模型从未见过给定物体运动反推机器人动作的样本。但它从统一的实体交互先验中自己推出来了。这是整篇工作在表征层面最有启发性的一点。04 实验结果掩码表征为什么碾压稀疏输入论文从三个维度做消融结论非常一致。4.1 同本体DROID训练域图 | 不同机器人本体下各基线量化指标对比DROID/BEHAVIOR 数据集LPIPS 从 Ctrl-World 的 0.362 降到 0.0945PSNR 从 18.15 提到 23.74。Wan-move、纯图生视频基线直接出现场景崩坏和机器人错位完全无法用于仿真。图 | DROID 数据集基线视觉效果对比图4.2 同机器人、全新定制夹爪骨架和末端可视化基线出现畸变模型强行把新夹爪扭曲成训练时见过的结构。掩码方案完整保留自定义执行器外形LPIPS 对比骨架的 0.169 降至 0.148。这组实验指向一个更深层的结论——只要用像素掩码机器人长什么样根本不重要。图 | 视觉动作条件消融定量指标对比DROID / 真实机器人 / BEHAVIOR4.3 未见过双臂人形机器人BEHAVIOR数据集这是最核心的泛化证明。Ctrl-World 和骨架基线生成的机器人扭曲、肢体穿模掩码方案流畅生成人形机器人开门、搬运交互PSNR 22.90 vs Ctrl-World 18.39。底层逻辑很直白骨架和末端只是孤立的几个空间点模型得自己脑补完整的机器人几何外形。掩码直接给了像素级外形模型不需要额外推理结构。跨本体泛化的代差来自信息量的代差。05 三大落地机器人应用场景整套统一世界模型不只是视频生成工具完整嵌入机器人决策链路覆盖评估、规划、逆动作提取三大刚需。图 | 观测噪声鲁棒性小提琴对比图与真实世界无人机轨迹跟踪效果图5.1 策略评估虚拟仿真结果贴合真实成功率用扩散策略输出多条动作输入掩码模型生成虚拟执行视频通过VLMGemini 3.1 Pro打分判断任务是否完成。仿真评估成功率和真实环境相关系数(r0.982)虚拟打分可以替代大量真机试错大幅降低调试损耗。客观局限模型存在轻微正向偏差更容易判定任务成功出现“幻觉式物体移动”评估时需要增加物理真实性约束无接触不判定成功。5.2 模型预测规划Best-of-N从随机扩散策略采样多条候选机器人掩码全部送入世界模型推演未来画面由VLM筛选最优轨迹再真机执行。实验显示随采样数量提升任务成功率稳定上涨属于典型测试时缩放方案无需重训策略直接提升现有机器人任务完成率。5.3 逆向动作提取零样本无需任务训练图 | 载荷、换桨鲁棒性轨迹对比图仅输入目标物体移动掩码模型零样本输出机器人完整交互视频再搭配逆动力学模型解析可执行关节指令。在咖啡杯搬运任务上成功率90%超过DP、ACT、SmolVLA主流模仿学习基线关键优势是该任务未参与模型训练纯零样本生成可用机器人行为。06 写在最后Masked Visual Actions的核心创新不在于复杂网络结构而是一套对齐视频模型原生视觉语言的动作表征范式。放弃数字指令、稀疏关键点直接把“动作画进画面”让预训练视频大模型不用额外适配就能理解各类机器人交互。图 | DROID 数据集内各基线生成效果可视化对比15小时微调、单模型双向推演、跨本体零样本三大特性大幅降低通用机器人世界模型落地门槛给具身智能通用模拟器提供一条轻量化、高泛化的全新技术路径。Ref论文标题Masked Visual Actions for Unified World Modeling论文链接https://arxiv:2607.19343项目主页https://masked-visual-actions.github.io