Figure新模型来了,零样本走进30个陌生家庭干家务,验证人机转换Scaling Law

智东西
3 hours ago

机器人前瞻(公众号:robot_pro)

作者 | 钟宸

编辑 | 漠影

机器人前瞻9月18日报道,今天,Figure发布了新模型Helix 2.5,这是其迄今为止构建的最先进的神经网络模型。

Figure将这一模型带到了30个真实的家庭环境中,并表示模型帮助机器人实现了零样本的全身自主行为(Zero-shot whole-body autonomy),这是在这种规模上,首次实现了人形机器人零样本全身行为泛化能力的演示。

同时,Figure将单一的预训练基础模型应用于三种不同的行为:移动、刚性及可变形物体的操控、双手协调运动,以及主动感知能力。

Figure还透露,只要保持任务特定数据(task-specific data)、架构、训练方法和评估方式不变,仅通过Index(Figure面向全球规模构建的机器人数据集项目)预训练就能将零样本识别的成功率从9%提高到56%,且该模型也验证了人机转换的Scaling Law(A Human-to-Humanoid Robot Transfer Scaling Law)

另外,在Helix 2.5中,所需的任务特定数据仅为Helix 02的一半。

一、展示四小时实机视频,可整理房间、铺床和叠毛巾

Figure在X上展示了约四个小时的视频,包含Helix-2.5在真实家庭完成整理房间、铺床、叠毛巾的长程任务演示,无需在任何环境或操控物体的过程中进行数据收集、微调或适应处理(collection,fine-tuning,or adaptation)。

Figure表示,这是首次在这一规模上,实现人形机器人零样本全身行为泛化能力的演示。

Figure放出的演示视频中,Helix 2.5的表现较为惊艳。工作人员故意把物品扔得满屋都是,机器人便在整个屋子里来回搜寻,一件一件捡起来,放进人类递来的篮子,最后还不忘记把篮子放到客厅角落里。整个流程耗时约一分半。

真正令人眼前一亮的是一个细节:捡最后一件物品时,机器人第一次抓取失败了,但它没有停下求助,而是换了个角度重新尝试。

Helix-2.5先是摆正枕头,再将被子铺平,甚至还记得把床沿处垂下来的被角也掖好整理。一套动作下来,比人类还要细心一点。

叠毛巾任务中,面对四条毛巾,Helix 2.5都是先摊开、再对折,过程中还不断调整铺平,动作几乎没出过错,只是四条毛巾叠完足足花了五分多钟,精准有余,速度尚待打磨。

另外,据Figure透露,该模型拥有从错误中恢复的能力

当面临诸如未捡起物体、拿起被子失败的错误时,机器人会后退一步,重新定位自己,然后围绕环境移动,以纠正错误并完成那些需要长期规划的任务。

二、承诺投入超200亿算力,Index预训练产生泛化能力

Figure指出,在训练过程中,模型必须利用已有的知识来解决整个感知与控制问题。在复杂的任务中实现自主行为,即使在熟悉的环境中也极为罕见。该公司称,Helix 2.5是第一个能够在家中、且面对从未接触过的物体时实现这一能力的模型

Figure还想要弄清楚,Helix 2.5的零样本泛化能力究竟是来自于Index预训练,还是来自于具体的任务数据本身?

于是,Figure在相同的任务特定数据上训练了两种策略,这些数据中并不包含任何评估样本或对象信息。

其中一个策略以随机权重初始化,另一个则基于Index预训练的Helix 2.5模型进行初始化。

Figure发现,Index预训练是Helix 2.5零样本能力实现的一大因素。在盲测中,从零开始训练的策略在测试中的成功率为9%,而采用Index预训练的策略则取得了 56%的成功率。

Figure还将Helix 2.5与Helix 02进行了比较。Helix 02是通过在评估后的环境中直接收集的数据进行训练的。Helix 2.5在使用的数据量仅为Helix 02的一半的情况下,仍然取得了与Helix 02相当的成功率。

另外,Figure还验证了人机转换的Scaling Law

该公司在扩展了8倍预训练数据的Index数据集上训练了四个模型,同时保持模型规模不变,也不对下游训练方式进行更改。这些模型都在相同的任务数据上进行微调,并且以相同的动作预测损失(held-out action-prediction loss)作为评估标准。

而随着数据的增加,损失也会相应减少。Figure指出,这是首次在人形机器人身上观察到这种Scaling Law,即Index预训练规模扩大,可以改善后续机器人行为的预测效果。

同时,Figure透露,两者的关系相关性足够准确,还可以进行预测。仅通过较小的样本,Figure就能在训练开始之前,将最大值的测试误差预测到四位小数的精度,在数据范围扩大的过程中,预测误差仅为0.54%。

目前,Figure称,Index每秒大约能生成35分钟的新人类经验数据。为了训练Helix模型,其已承诺投入35亿美元(约合234.43亿元人民币)的算力资源。

结语:高额投入,砸出一条Scaling Law

在X(原推特)上,部分网友对这一成果表示认可,还希望能够尽快用上这个机器人。

但也有人表示,需要观察这个模型能不能完成更多的任务。

但不可否认的是,Figure用真实任务证明,Index预训练能将零样本成功率从9%拉到56%,且扩大预训练数据可持续改善下游行为预测,这一定程度上证明,具身智能的数据飞轮开始具备可预测、可扩展的工程范式。

当然,超两百亿的承诺算力投入又提醒着所有人,这条路的门槛极高。但当机器人能用一半的任务数据达到同等效果,具身模型的路线图已愈发清晰。接下来的悬念是:谁能以更低成本,跑通这条Scaling Law曲线?

技术博客:https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization

X链接:https://x.com/Figure_robot/status/2100657350952779925

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10