GEN‑1.5引爆具身智能:机器人迎来属于自己的GPT‑3时刻
当大语言模型走过GPT‑3到ChatGPT的发展历程,机器人领域也迎来标志性节点。硅谷公司Generalist AI对外发布新一代机器人基础模型GEN‑1.5,被众多研究者称作具身智能的GPT‑3时刻。该项目拿到4亿美元融资,李飞飞、英伟达、林斌等行业大佬参与投资,资本市场已经提前押注这条技术路线。
传统机器人学习一项新操作,例如拧开瓶盖,往往需要工程师花费数月编写调试代码。而GEN‑1.5实现了零代码少样本学习:向机器人播放一段3‑12秒的人类动作演示,无需重新训练或者大规模参数微调,机器人就可以直接复刻任务。在十项实操任务测试当中,只看一遍演示的one‑shot模式平均成功率达到59%;搭配少量演示数据做轻度微调之后,few‑shot模式平均成功率提升至83%。
该模型最令人惊喜的不是简单模仿动作,而是自主涌现即兴解决策略。大量测试案例显示,面对从未见过的工具、突发障碍,模型可以自行生成全新的处理逻辑。比如原本训练用刷子把积木扫入碗中,替换为簸箕之后,机器人不再执行“扫”的动作,而是改用铲、倾倒的全新流程;遇到被纸张盖住的碗、粘在机械手上的积木,模型也会自发完成掀开、剥离等修复动作。这些行为不在预训练样本当中,完全从海量物理交互预训练数据里自然产生。
这背后印证了具身智能缩放定律:随着物理场景数据规模扩大、预训练时间拉长,机器人的泛化能力持续变强,模型误差没有出现收敛迹象。还有一个反直觉结论,微调的梯度步骤越少,模型保留的预训练经验越完整,即兴变通的能力反而更强。GEN‑1.5还打通仿真演示到实体机器人的通路,模拟器录制的动作,实体机器人可以直接落地执行,适配不同机械手和物体摆放位置,整套能力没有依靠专门改造架构,完全来自长期大规模预训练沉淀。
GEN‑1.5提出物理提示Physical Prompting的新概念,相当于把语言领域的上下文学习迁移到现实物理世界。将动作演示送入模型上下文窗口,就可以唤醒模型已经积累的物理经验,适配新任务的成本被压到极低。不过客观来看,现阶段能力还停留在短程简单操作,复杂长程现实任务依旧难以胜任,全部测试结果由厂商自行披露,还缺少第三方独立验证。类比大模型发展路径,它更接近2020年GPT‑3的状态:方向清晰、潜力巨大,但距离成熟可用的“机器人ChatGPT”,还有很长迭代周期。
就在GEN‑1.5发布的同一周,人形机器人硬件产业迎来密集活动。宇树科技登陆资本市场,人形机器人出货量位居全球前列,但招股书也暴露出行业共性痛点:硬件躯体制造已经取得突破,具身智能大脑模型却成为发展瓶颈,营收增速、利润都被高额研发投入拖累。硬件厂商可以造出性能出色的机器人本体,但缺少通用智能模型,硬件价值就很难充分释放。
如果缩放定律能够持续成立,那么未来人形机器人赛道的竞争,核心就会转向物理交互数据的争夺,复刻当年大语言模型的数据军备竞赛。资本已经提前行动,Generalist AI已经在洽谈新一轮融资。但行业研究者也保持理性,当前演示任务场景相对简单,距离家庭、工厂复杂真实环境大规模上岗,仍有不少技术关卡等待跨越。
总的来说,GEN‑1.5的意义不在于已经造出完美通用机器人,而是实证了一条可行路线:依靠海量物理预训练数据,让普通人仅凭演示,就能教会机器人干活。硬件与智能模型两条赛道正在交汇,人形机器人行业的博弈,正式从比拼硬件工艺,走向“大脑”基础模型的较量。
声明:本站所有文章资源内容,如无特殊说明或标注,均为采集网络资源。如若本站内容侵犯了原著者的合法权益,可联系本站删除。
