人工智能

用GPT-4训练机器人 英伟达最新Agent开源:任务越复杂越拿手

字号+作者: 来源:量子位 2023-10-23 17:40 评论(创建话题) 收藏成功收藏本文

英伟达Eureka在超过80%的任务中都超越人类专家,让机器人平均性能提升到50%以上。训练机器人,AI比人类更拿手!英伟达最新AIAgentEureka ,用GPT-4生成奖励函'...

英伟达Eureka在超过80%的任务中都超越人类专家,让机器人平均性能提升到50%以上。训练机器人,AI比人类更拿手!英伟达最新AIAgentEureka ,用GPT-4生成奖励函数,结果教会机器人完成了三十多个复杂任务。比如,快速转个笔,打开抽屉和柜子、抛球和接球。CDX品论天涯网


CDX品论天涯网

尤其是转笔这个技能,要知道靠人类逐帧制作动画,也是非常困难的。CDX品论天涯网

最终,Eureka在超过80%的任务中都超越人类专家,让机器人平均性能提升到50%以上。CDX品论天涯网

这一研究吸引了数十万网友关注,有人表示:直接快进到它弹钢琴那天,直接为大众所用。CDX品论天涯网


CDX品论天涯网


CDX品论天涯网

英伟达科学家,也是此次共同作者之一JimFan评价到,它是超级人类奖励工程师。它可以辅助机器人工程师设计复杂任务。CDX品论天涯网

目前该项目完全开源。CDX品论天涯网

GPT-4生成奖励策略CDX品论天涯网

在机器人学习中,大模型擅长生成高级语义规划和中级操作,比如拾取和放置(VIMA、RT-1等),但在复杂任务控制方面有所欠缺。CDX品论天涯网

而Eureka的关键所在,就是通过上下文来实现了人类水平的奖励算法设计。CDX品论天涯网

简单来说,就是用GPT-4的零样本生成、代码编写以及上下文改进功能,对奖励执行策略进行优化,由此通过强化学习来进行复杂的技能。CDX品论天涯网


CDX品论天涯网

研究人员提出了一种混合梯度架构,外循环运行GPT-4来细化奖励函数(无梯度),而内循环运行强化学习来训练机器人控制器(基于梯度)。CDX品论天涯网

主要有三个关键组成部分:CDX品论天涯网

  • 模拟器环境代码作为上下文启动初始“种子”奖励函数。CDX品论天涯网

  • GPU上的大规模并行强化学习,可以快速评估大量候选奖励。CDX品论天涯网

  • 奖励反射rewardreflection,得益于GPT-4评估和修改能力,一步步迭代。CDX品论天涯网

  • 首先,无需任何特定提示工程和奖励模版。使用原始IsaacGym (一种GPU加速的物理模拟器)环境代码作为上下文,生成初始奖励函数。CDX品论天涯网

    这种无梯度的情境学习方式,可以根据各种形式的人类输入,生成性能更强、符合开发人员愿景的奖励函数。CDX品论天涯网

    其次,Eureka在每个进化步骤中都会生成很多候选函数,然后利用强化学习训练来进行快速评估。CDX品论天涯网

    以往这种过程需要几天甚至几周来完成,但由IsaacGym可将模拟时间提高1000倍,强化学习内循环能在几分钟完成。CDX品论天涯网

    最后,依赖于奖励反射,Eureka还支持一种新形式的上下文RLHF。它能够将人类操作员的反馈融入自然语言中,以引导和调整奖励功能。CDX品论天涯网

    最终,在29种不同的开源RL环境中,83%基准测试中Eureka都优于人类,并实现了52%改进。CDX品论天涯网


    CDX品论天涯网

    这些环境包括10种不同的机器人形态,比如四足机器人、四旋翼机器人、双足机器人、机械手等。CDX品论天涯网


    CDX品论天涯网

    让研究人员惊讶的是,尤其在处理复杂、高维电机控制的任务上,Eureka表现更好,且与人类奖励的相关性越低。CDX品论天涯网

    甚至在少数情况下,AI的策略与人类的策略呈现负相关。CDX品论天涯网


    CDX品论天涯网

    这就有点像当年AlphaGo的下棋策略,人类看不懂学不会,但十分有效。CDX品论天涯网

    英伟达出品CDX品论天涯网

    这项研究由英伟达、宾夕法尼亚大学、加州理工学院、德州大学奥斯汀分校的研究人员来完成。CDX品论天涯网


    CDX品论天涯网

    可以看到的是,近半数研究人员都是华人。CDX品论天涯网

    一作是YechengJasonMa,目前是宾大GRASP实验室的四年级博士生,研究方向是强化学习和机器人学习。CDX品论天涯网

    英伟达科学家JimFan此次也是通讯作者之一。CDX品论天涯网

    咳咳,不过至于网友提到的弹钢琴,JimFan自己曾分享过:只需几个简单按钮,AI就能实时即兴生成演奏音乐。CDX品论天涯网


    CDX品论天涯网

    不知道,未来会不会这样的呢?(不过,这研究已经是2018年的了)CDX品论天涯网

    本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]