无需专属机器人大脑!MVA 像素接口打通视频模型与异构机器人
当下具身智能赛道普遍陷入内卷:各大企业耗费巨额成本从零训练机器人专属基座模型,依赖海量真机操作数据学习动作指令,但这套方案存在难以根治的短板 —— 传统模型直接输出关节角度、末端位移等底层数值指令,动作表征与特定机械臂本体深度绑定,一旦更换机械臂构型,整套控制策略直接失效,工厂、仓储场景跨设备部署成本居高不下。同时,海量互联网视频蕴藏丰富物理交互先验,成熟视频生成模型可精准推演物体碰撞、倾倒、滑动等物理行为,却因缺少适配翻译接口,无法将视觉认知转化为机器人可执行的操作指令。
针对行业双重瓶颈,李飞飞、Yilun Du 两大分野路线学者罕见联手,联合吴佳俊、ControlNet 作者张吕敏等十余位顶尖研究者推出《Masked Visual Actions for Unified World Modeling》论文,提出MVA 掩码视觉动作像素级统一接口,重构视频模型与机器人的交互逻辑,核心思路摒弃 “让视频模型学习机器人数字语言” 的传统路径,改用视频模型原生的像素视觉语言传递动作信号。
整套 MVA 框架仅分三步极简流程,核心创新在于时空掩码完形推演机制:第一,借助SAM 通用分割模型识别画面内机械臂、操作物体,逐帧提取二者轮廓生成动态遮罩,将机器人全部操作动作转化为随时间流动的色块运动轨迹,全程不涉及关节坐标、角度等机器专属数字,完全贴合视频模型的视觉认知逻辑。第二,通过选择性遮挡轨迹实现双向统一建模,无需切换模型参数:遮挡物体运动轨迹、保留机械臂色块,模型作为正向世界模拟器,根据机械臂动作推演物体、环境的后续变化;遮挡机械臂轨迹、保留目标物体移动路径,同一模型切换为逆向动作生成器,反推出完成目标任务所需的机械臂运动方案,一套权重兼顾模拟与规划两类核心需求。第三,采用 LoRA 轻量化微调复用成熟开源视频基座,研究团队基于 140 亿参数 Wan2.2 视频模型开展实验,仅投入15 小时机器人交互数据完成微调,不用重新训练庞大视频基座,既保留模型原生积累的海量物理视觉先验,又大幅压缩训练算力、时间成本,对比传统方案数万元训练开销、上万小时真机数据形成碾压级优势。
为彻底解决异构机械臂泛化难题,MVA 框架引入行业通用URDF 机器人描述文件作为中间适配层,搭建 “像素轨迹输出 — 运动学解算 — 机械臂执行” 分层链路:模型仅输出末端空间目标位置,再依托 URDF 记载的关节长度、转动限制参数,通过正 / 逆运动学(FK/IK) 自动适配不同机型,换算对应机械臂专属关节指令;同时 URDF 自带运动边界约束,可限制视频模型天马行空的无效生成,杜绝物理上无法实现的畸形机械臂姿态,提升画面推演与实操落地的一致性。
多项对比实验数据验证 MVA 方案的优越性:衡量画面还原精度的 LPIPS 指标低至 0.0945,远优于主流 Ctrl-World 方案的 0.362;训练仅使用单臂机器人数据,零样本测试全新双臂机械臂仍可输出可靠动作预测,传统数值动作模型在此场景完全失灵。落地层面,MVA 可实现三类实用功能:一是对多条候选动作开展策略打分,在虚拟画面预演操作结果后择优执行;二是充当轻量化规划器,无需额外训练策略网络,依靠反复视觉推演生成完整操作路径;三是根据任务目标反向输出全套机械臂配合动作,适配分拣、抓取、搬运等工业场景。
从产业落地视角来看,MVA 技术精准踩中 2026 年具身智能视觉、动作分层解耦的行业大趋势:视觉认知依托互联网海量免费视频数据,动作适配依靠少量真机数据搭配运动学计算,两类资源优势互补。以往学界 “抽象数字表征” 与 “直观视觉推演” 两条对立技术路线,在 URDF 运动学解算这一底层逻辑上达成共识,证明具身智能发展不必局限于单一路线。
这篇联合论文带来颠覆性行业启示:具身智能发展的核心不在于持续做大机器人专属基座,而在于搭建高效通用的视觉交互接口,盘活存量成熟视频大模型的海量物理认知;MVA 像素掩码接口消除视频模型与机器人之间的表征壁垒,以极低成本实现跨机型通用操控,有望彻底解决工业场景机械臂换设备宕机、重复训练的长期痛点,为通用低成本机器人落地开辟全新技术路线。
声明:本站所有文章资源内容,如无特殊说明或标注,均为采集网络资源。如若本站内容侵犯了原著者的合法权益,可联系本站删除。
