【导语】本文作为NVIDIA“机器人研究与开发摘要 (R²D²) ”的一部分,聚焦于NVIDIA研究中心在物理AI和机器人应用领域的最新突破。随着机械臂在装配、包装等领域的广泛应用,对机械臂的适应性提出了更高要求。为了实现机械臂在复杂环境中的灵活决策与行为调整,NVIDIA研究中心推出了多项创新工(gōng)作(zuò)流(liú)和(hé)AI模(mó)型(xíng),包(bāo)括(kuò)DextrAH-RGB灵(líng)巧(qiǎo)抓(zhuā)取(qǔ)工(gōng)作(zuò)流(liú)、DexMimicGen双(shuāng)手(shǒu)操(cāo)控(kòng)数(shù)据(jù)生(shēng)成(chéng)流(liú)程(chéng)以(yǐ)及(jí)GraspGen抓(zhuā)取(qǔ)数(shù)据(jù)集。这(zhè)些(xiē)成(chéng)果(guǒ)旨(zhǐ)在(zài)解(jiě)决(jué)机(jī)器(qì)人(rén)面(miàn)临(lín)的关键挑战,如适应性和数据稀缺问题,推动机器人技术向更高层次发展。
这篇文章是“NVIDIA 机器人研究与开发摘要 (R²D²) ”的一部分,旨在让开发者更深入地了解 NVIDIA 研究中心在物理 AI 和机器人应用方面的最新突破。
如今,机械臂被广泛应用于装配、包装、检测等众多领域。然而,它们(men)仍(réng)需(xū)预(yù)先(xiān)编(biān)程(chéng)才(cái)能(néng)执(zhí)行(xíng)特(tè)定(dìng)且(qiě)往(wǎng)往(wǎng)是(shì)重(zhòng)复(fù)性(xìng)的(de)任(rèn)务(wu)。为(wèi)了(le)满(mǎn)足(zú)在(zài)大(dà)多(duō)数(shù)环(huán)境(jìng)中(zhōng)对(duì)适(shì)应(yīng)性(xìng)日(rì)益(yì)增(zēng)长(zhǎng)的(de)需(xū)求(qiú),需(xū)要(yào)具(jù)备(bèi)感(gǎn)知(zhī)能(néng)力(lì)的(de)机(jī)械(xiè)臂(bì),以(yǐ)便(biàn)根(gēn)据(jù)实(shí)时(shí)数(shù)据(jù)做(zuò)出(chū)决(jué)策(cè)并(bìng)调(diào)整(zhěng)行(xíng)为(wèi)。这(zhè)不(bù)仅(jǐn)能让机械臂在协作环境中执行各类任务时更加灵活,还能通过对危险的感知来提升安全性。
本期的“NVIDIA 机器人研究与开发摘要 (R²D²) ”探讨了 NVIDIA 研究中心和机器人灵巧操作、物体操控和抓取有关的工作流以及 AI 模型(相关成果如下文),以及它们如何应对机器人面临的关键挑战,如适应性和数据稀缺问题:
DextrAH-RGB:一种基于立体 RGB 输入实现灵巧抓取的工作流。
DexMimicGen:一种利用模仿学习 (IL) 进行双手灵巧操控的数据生成流程,在 2025 年 IEEE 国际机器人与自动化会议 (ICRA) 上展示。
GraspGen:一个包含超过 5700 万个针对不同机器人和夹具的抓取数据的合成数据集。
什么是灵巧机器人?
灵巧机器人能够精确、灵活且高效地操控物体。机器人的灵巧性涉及精细的运动控制、协调能力,以及在非结构化环境中处理各种任务的能力。机器人灵巧性的关键方面包括抓握、操控、触觉敏感度、敏捷性和协调性。
机器人的灵巧性在制造业、医疗健康和物流等行业中至关重要,它使那些传统上需要人类精准操作的任务实现自动化成为可能。
NVIDIA 的机器人灵巧操作
工作流及模型
灵巧抓取是机器人技术中的一项具有挑战性的任务,要求机器人能够精确且快速地操控各种各样的物体。传统方法在处理反光物体时往往存在困难,并且难以很好地推广应用到新的物体或动态环境中。
NVIDIA 研究中心通过开发端到端的基础模型和工作流来(lái)应(yīng)对(duì)这(zhè)些(xiē)挑(tiāo)战,这些模型和工作流能够让机器人在不同物体和环境中实现稳定可靠的操控。
用于灵巧抓取的 DextrAH-RGB
DextrAH-RGB 是一种基于立体 RGB 输入,实现机械臂手部灵巧抓取的工作流。利用这一工作流,相关策略完全在仿真环境中进行训练,并且在实际部署时能够应用于各种新的物体。DextrAH-RGB 借助NVIDIA Isaac Lab,在仿真环境中针对不同物体进行了大规模训练。
训练过程分为两个阶段。首先,运用强化学习 (RL) 在仿真环境中训练一个教师策略。教师策略是一种特殊的织物引导策略 (FGP),它在几何织物动作空间内发挥作用。几何织物是一种矢量化的底层控制方式,将运动转化为关节位置、速度和加速度信号,并以命令的形式传输给机器人的控制器。通过嵌入避障和目标达成行为,这种方式在部署时确保了安全性和响应速度,从而实现快速迭代。
教师策略有一个长短期记忆 (LSTM) 层,能够对现实世界的物理特性进行推理和适应。这有助于融入诸如重新抓取和理解抓取成功与否等纠正行为,以应对当前的动态情况。训练的第一阶段通过利用领域随机化来确保策略稳定健性和适应性。在训练教师策略时,会改变物理、视觉和干扰参数,逐步增加环境的难度。
在训练的第二阶段,使用逼真的平铺渲染技术,将教师策略提炼为仿真环境中基于 RGB 的学生策略。这一步使用了一个名为 DAgger 的模仿学习框架。学生策略通过立体相机接收 RGB 图像,从而能够间接地推断出物体的深度和位置。

图 1. DextrAH-RGB 训练流程
波士顿动力 Atlas MTS 机器人
实现从仿真到现实的应用
NVIDIA 与波士顿动力合作,对 DextrAH-RGB 进行训练和部署。图 2 和视频 2 展示了一个由通用策略驱动的机器人系统,该系统在 Atlas 机器人的上半身成功部署了强大的、具备零样本从仿真到现实抓取能力的策略。

图 2. 使用 Isaac Lab 大规模训练 Atlas 机器人的教师策略
该系统展示了由 Atlas 机器人的三指夹具驱动的多种抓取方式,这些夹具能够抓取轻物和重物,并显示出逐渐形成的故障检测和重试行为。
视频 2. 波士顿动力 Atlas MTS 机器人
使用 DextrAH-RGB 成功抓取工业物体
用于双手操控数据生成的
DexMimicGen
DexMimicGen 是一种用于双手操控数据生成的工作流,它使用少(shǎo)量(liàng)的(de)人(rén)类(lèi)演(yǎn)示(shì)来(lái)生(shēng)成(chéng)大(dà)规(guī)模(mó)的(de)轨(guǐ)迹(jī)数(shù)据(jù)集。其(qí)目(mù)的(de)是(shì)通(tōng)过(guò)让机器人(rén)在仿真环境中学习动作(这些动作可以迁移到现实世界中),来减少手动数据收集这一繁琐的任务。这个工作流解决了人形机器人在双手灵巧操作的模仿学习中数据稀缺的挑战。
DexMimicGen 使用基于仿真的增强技术来生成数据集。首先,人类演示者使用远程操作设备收集少量演示数据。然后,DexMimicGen 在仿真环境中生(shēng)成(chéng)大(dà)量(liàng)的(de)演(yǎn)示(shì)轨(guǐ)迹(jī)数(shù)据(jù)集。例(lì)如(rú),在(zài)最(zuì)初(chū)发(fā)布(bù)时(shí),借(jiè)助(zhù) DexMimicGen,研(yán)究(jiū)人(rén)员(yuán)仅(jǐn)从(cóng) 60 个(gè)人(rén)类(lèi)演(yǎn)示(shì)中(zhōng)就(jiù)生(shēng)成(chéng)了(le) 21000 个(gè)演(yǎn)示(shì)数(shù)据(jù)。最后,使用模仿学习在生成的数据集上训练一个策略,以执行操控任务,并将其部署到真实的机器人上。

图 3. DexMimicGen 工作流
双手操控具有挑战性,因为在不同任务中需要两只手臂之间进行精确的协调。比如两只手分别抓取不同物体这样的并行任务,需要独立的控制策略。再比如抬起一个大物体这样的协调任务,需要两只手臂同步动作和时间。顺序任务则要求子任务按照一定的顺序完成,比如用一只手移动一个盒子,然后用另一只手把一个物体放进去。
DexMimicGen 在数据生成过程中考虑到了这些不同的要求,采用了(le)一(yī)种(zhǒng) “并(bìng)行(xíng)、协(xié)调(diào)和(hé)顺(shùn)序(xù)” 的(de)子(zi)任(rèn)务(wu)分(fēn)类(lèi)法(fǎ)。对(duì)于(yú)独(dú)立(lì)的(de)手(shǒu)臂(bì)子(zi)任(rèn)务(wu),使(shǐ)用(yòng)异(yì)步(bù)执(zhí)行(xíng)策(cè)略(è);对(duì)于(yú)协(xié)调(diào)任(rèn)务(wu),使(shǐ)用(yòng)同(tóng)步机制;对于顺序子任务,使用顺序约束。这种方法确保了在数据生成过程中精确的对齐和逻辑的任务执行。

图 4. 使用基于 DexMimicGen 生成的
数据训练(liàn)的(de)模(mó)型(xíng)成(chéng)功(gōng)对(duì)罐头进行分类
当在真实(shí)世(shì)界(jiè)中部署时,借助 DexMimicGen 的“现实—仿真—现实”数据生成流程生成的数据,人形机器人在进行罐头分类任务时,实现了 90% 的成功率。相比之下,仅使用人类演示数据进行训练时,模型的成功率为 0%。这些结果充分表明,DexMimicGen 在减少人力投入的同时,能够让机器人更有效地学习复杂的操控任务。
适用于多种机器人和(hé)夹(jiā)具的
GraspGen 数据集
为了支持相关研究,GraspGen 在 Hugging Face 平台上提供了一个全新的仿真数据集,其中包含针对三种不同夹具的 5700 万个抓取数据。该数据集涵盖了不同物体网格的 6D 夹具变换数据以及抓取成功的标签。

图 5. 数据集中一系列不同物体的建议抓取方式
这三种夹具分别是 Franka Panda 夹具、Robotiq 2F-140 工业夹具和单触点吸盘夹具。GraspGen 数据集完全是在仿真环境中生成的,展示了自动数据生成在扩大数据集规模和多样性方面的优势。

图 6. GraspGen 仿真数据集中三种夹具的坐标系约定:Robotiq 2F-140 夹具(左)、单触点吸盘夹具(中)和 Franka Panda 夹具(右)
总结
为了满足在大多数环境中对适应性日益增长的需求,需要机械臂能够根据实时数据做(zuò)出(chū)决策并调整行为。本文探讨了几种机器人灵巧操作、操控和抓取工作流以及 AI 模型,以及它们如何应对机器人面临的关键挑战,如适应性和数据稀缺问题。