8个月窗口期:具身AI大脑,从动作优化走向任务闭环
在2026年的具身智能赛道,世界动作模型WAM成为行业热点,不少技术方案追求快速推理、隐空间预演动作后果,力求实现机器人“想清楚再动”。但行业逐渐意识到,动作本身不等于工作目标,一味打磨单步动作,难以解决真实工业场景长流程作业的痛点,一场技术范式变革正在酝酿,留给行业的窗口期仅剩8个月。
WAM的核心逻辑是联合建模动作与未来视觉画面,把资源投入在单步动作片段的优化。不少方案可以做到极快推理速度,也能够在潜空间对短时间未来状态进行推演,但推演视野大多只有2‑3秒,更长任务链条下收益会快速衰减。即便单步动作成功率很高,多步骤串联之后,受误差乘法累积效应影响,整体任务成功率会大幅下滑。 举个例子,一项包含10个步骤的作业,每一步成功率95%,最终整体成功率仅有60%;就算单步提升至99%,整体成功率也仅90%。这也解释了展会里经常出现的现象:机器人每一个拆分动作演示稳定,一旦执行完整连续任务就容易翻车。这便是WAM与生俱来的天花板:它是优秀的动作优化器,却不是合格的任务完成者。就像一名马拉松选手,每一步姿态、配速都做到完美,却不了解完整赛道,最终未必可以顺利完赛。
工业客户并不关心机器人动作姿态是否优雅,真正关心的是产线最终良率,也就是任务能不能完整交付。在此背景下,世界任务模型WTM的概念被提出,它代表一套全新模型范式:同步对世界动态与动作进行建模,将任务进度、子目标完成度、最终任务成功率作为核心监督信号与优化目标。它不再孤立评判每一步动作好坏,而是判断每一次决策是否推动整体任务向前推进。
WTM与WAM存在三层本质差异: 第一,优化目标不同。WAM追求给定观测与指令输出最优单步动作;WTM面向完整动作轨迹,判断整套执行路径最终能否完成任务。 第二,误差处理方式不同。WAM每一步误差独立计算,不断累积放大;WTM在任务进度维度消化偏差,一旦执行出现偏移,模型根据任务进度停滞立刻调整策略,避免偏差一路传导至任务结尾。 第三,评测数据真实性不同。WAM常用单步成功率作为指标,容易和真实场景脱节;WTM直接以任务最终成功率作为评判标准,指标直白,贴合商业客户的真实诉求。
通俗来讲,WAM如同精益求精的工匠,纠结每一处细节做工;WTM更像把控交付结果的项目经理,只以最终成品合格作为标尺。客户付费采购机器人,购买的是可以交付的结果,不是表演性质的精细动作。
当前各家技术厂商处在向WTM演进的不同阶段。 Physical Intelligence没有使用世界模型的标签,但在VLA体系内加入高层子任务预测、视觉子目标表征,让动作生成以子任务完成为条件,是距离完整WTM最近的方案,短板在于子目标只是输入条件,还没有成为联合训练的核心监督信号。
国内星源智的ω‑EVA搭建起“预判‑校验‑执行”交互闭环,支持从失败数据迭代学习,已经具备WTM的交互雏形,但修正局限在局部状态闭环,缺少显式任务图与任务进度回归模块,属于站在WAM顶峰、站在WTM门前的玩家。
酷哇的DAWN架构,实现世界预测器与动作降噪器递归互相修正,在轮式移动场景表现出众。不过其场景以连续导航控制为主,子任务边界模糊,和工业操作任务的WTM属于两条不同赛道。
极佳视界GigaWorld‑Policy‑0.5拥有亮眼工程能力,推理速度可以做到85毫秒,但是为了部署效率,推理阶段放弃未来世界推演,是典型以动作为中心的WAM方案,距离WTM最远。
橡木果走出一条差异化路线,不做传统世界模型,依靠端侧本能模型,借助触觉闭环实现极高的单步执行可靠性,用降低单步出错概率的方式,削弱乘法误差带来的负面影响,达成任务可靠交付的效果。这也带来重要启示:WTM不一定必须依托世界模型架构,只要实现任务级可靠完成,本能驱动、端侧技能闭环都可以作为等价实现路径。
由WAM转向WTM,本质是一次认知层面的升级。WAM属于还原论思路,寄希望于把每个动作做到极致,拼凑出完整任务;WTM遵循系统论思路,直接锚定最终任务结果,动作只是达成目标的手段。
这也标志具身智能行业正式告别Demo玩具期,进入真实落地的工具期。未来8个月,各家技术路线都将迎来产业现实的拷问,比拼的不再是推理速度、炫酷演示,而是能不能在真实产线中,实实在在把任务完成。这个新提出的WTM属于行业预判概念,尚未形成学界统一标准,但代表着具身AI大脑无可回避的演进方向。
声明:本站所有文章资源内容,如无特殊说明或标注,均为采集网络资源。如若本站内容侵犯了原著者的合法权益,可联系本站删除。
