ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

【RSS 2025】YOTO:一次人类视频示教的双臂机器人操作|从机器人数据引擎视角

【RSS 2025】YOTO:一次人类视频示教的双臂机器人操作|从机器人数据引擎视角 摘要本文解读 RSS 2025 论文《You Only Teach Once: Learn One-Shot Bimanual Robotic Manipulation from Video Demonstrations》。该论文提出YOTO一个只需一次人类双手视频示教就能学会双臂长程操作的框架通过融合稀疏关键位姿抽象、运动掩码与点云级几何变换增殖把一段抖动、不连续的人类手部轨迹转换成可编辑、可倍增的机器人动作其特别之处在于既不需要遥操作硬件也不需要动捕手套。实验表明五个真实长程任务的五任务平均成功率达到 76.8%是次优基线 EquiBot23.4%的 3.3 倍分布外摆位下仍有 35.0% 的平均成功率、而三个纯模仿学习基线直接归零为数据成本高企的双臂模仿学习提供了一条从人教一次出发的新路径。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么双臂操作的数据这么贵研究主线从问题到结论基准/方法设计把教一次拆成三段分类全景双臂示教数据的三条来源方法细节关键位姿、增殖与 BiDP关键位姿把抖动轨迹压成十几个点增殖一条路径保可达另一条保多样性BiDP三个改进都围绕同一前提实验设计与结果评测协议与硬件数据采集效率为什么必须放弃遥操作主结果76.8% 对 23.4%消融表示设计与数据多样性同等关键分布外泛化基线集体归零手部轨迹质量的验证任务与物体详解失败案例结果对比总结关键发现局限性常见问题FAQYOTO 需要多少次人类示教为什么要把连续手部轨迹换成关键位姿增殖出来的示范为什么可信BiDP 和通用的扩散策略有什么不同为什么基线在分布外摆位下会归零这套框架能迁移到别的机械臂或任务吗参考链接论文基本信息项目内容标题英文You Only Teach Once: Learn One-Shot Bimanual Robotic Manipulation from Video Demonstrations标题中文YOTO一次人类视频示教的双臂机器人操作作者Huayi Zhou、Ruixiang Wang、Yunxin Tai、Yueci Deng、Guiliang Liu、Kui Jia机构The Chinese University of Hong Kong, Shenzhen、Harbin Institute of Technology, Weihai、DexForce会议RSS 2025arXiv2501.14208项目网站hnuzhy.github.io/projects/YOTO背景与动机为什么双臂操作的数据这么贵双臂操作是具身智能里一个长期成立的老问题它的难点有两个一是两条手臂的时空协调二是动作空间维度很高。围绕这两个难点主流研究分成两条路线。第一条是按预定义的任务分类把双臂任务拆成可枚举的技能代表性工作如 PerAct2、VoxAct这条路线的问题是难以均匀覆盖任意任务同时限制了机械臂的灵活性。第二条是直接用遥操作采集示范例如 ALOHA 与 ACT、RDT、π0它需要大量训练数据采集成本高而且遥操作轨迹本身是非稳态、去空间化的对训练鲁棒且可泛化的策略并不友好。第三条路是用人类手部视频替代遥操作代表工作是 DexCap 这一流派。它把人体动作当作天然的教学信号但通常依赖动捕手套或人形本体这类专用硬件并且把连续轨迹逐步回放给机器人。YOTO 想做的正是把这条路的两个前提都去掉只要一台普通的第三人称双目相机而且不逐帧回放手部轨迹。论文把数据从哪来和动作怎么表示当成同一件事来处理。关键帧keyframes抽象在 PerAct、C2FARM 里已经被用于长程操作建模YOTO 继承了这一表示并把它变成可以被脚本编辑、被几何变换倍增的数据单元策略侧则沿用视觉运动模仿学习的技术栈ACT 的动作分块、Diffusion Policy 的条件去噪、DP3 的点云观测与 EquiBot 的 SIM(3) 等变策略并把它们全部换成点云观测后作为公平基线重训。研究主线从问题到结论图 1YOTO 研究主线Mermaid 流程图。基准/方法设计把教一次拆成三段YOTO 的整体结构由三个模块串成闭环。第一个模块是手部动作提取与注入用 WiLoR 估计三维手部网格MANO 表示用 Florence-2 做开放词汇检测、SAM2 做分割取出被操作物体左手视图常开用于手部特征提取右视图只在需要精确深度时唤醒这样立体匹配的算力至少减半。第二个模块是单次示教的示范增殖既在真机上自动重放验证也在点云层面对物体施加受控的几何变换。第三个模块是双臂扩散策略 BiDP的训练与部署。三个模块共享同一个中间表示离散的关键位姿加上描述两臂协调的运动掩码。它既是机器人可以直接执行的动作也是可以被编辑、被倍增的数据单元——这一点是全文的关键。硬件上是两台 Aubo i5 对置放置配 DH-Robotics 的 PGI 平行夹爪最大开合 80 mm与 DexSense 双目工业相机。图 2YOTO 面向多种复杂长程双臂任务。只需单次第三人称双目相机观测即可提取细粒度人类手部运动轨迹用于双臂协调动作注入与训练示范的快速增殖。上排为严格异步任务拉抽屉并放置、倒水、拧瓶盖下排为非抓取式的同步任务揭盖、拆快递箱。分类全景双臂示教数据的三条来源图 3双臂示教数据的三条来源Mermaid 图。方法细节关键位姿、增殖与 BiDP关键位姿把抖动轨迹压成十几个点三维手部位姿不是直接照搬网格的位姿轨迹而是用手腕、食指指尖与无名指指尖三个点构造旋转矩阵这样比直接使用单目网格回归的朝向更稳定。夹爪开合状态用是否与物体接触来判定比只看手指弯曲更可信。随后在夹爪状态跳变、或者速度与加速度的局部极值处自动切分关键帧再用逆运动学插值把关键位姿连成可执行轨迹。这里还有一个容易被忽略的设计运动掩码记录每条手臂在每个关键帧上是保持还是移动严格异步任务据此删掉那些纯粹等待的关键位姿删掉的个数是 $K |\widetilde{\mathbf{A}}| / 2$。图 4YOTO 总览三个模块串成闭环。(a) 人类手部动作提取与注入(b) 由单次示教出发的训练示范增殖(c) 定制双臂扩散策略 BiDP 的训练与部署。图 5提取出的运动轨迹与对应关键帧示例左手与右手。紫色为左臂关键位姿青色为右臂关键位姿编号顺次为子步顺序两端为初始机器人状态。增殖一条路径保可达另一条保多样性增殖有两条路径。第一条是真机自动重放按运动掩码把关键位姿拆成左臂和右臂两组轨迹只改动与物体相关的那些关键位姿例如沿 X 轴平移 5 cm就能让真机重放同类动作并完成验证。论文给出的规模证据是一个示教良好的任务大约 8 小时可以采集 300 条示范速度远快于遥操作而且示范本身是稳态的。第二条路径在点云层面对被分割出来的物体点云施加受控的旋转与平移同步更新对应关键位姿的 6-DoF 数值得到成对的观测与动作标签单次只需 1.5 秒。两条路径互补真机重放保证动作可达、可执行几何变换保证视觉观测在位置与物体类别上的多样性而后者是把数据规模推到数百倍量级的唯一可行方式。BiDP三个改进都围绕同一前提BiDP 相对通用扩散策略做了三处修改。第一观测从整场景点云缩到被操作的物体点云只保留 $1024$ 个点收敛更快也更能抗干扰。第二预测目标是关键位姿而不是连续动作序列直接把扩散空间的维度降下来。第三动作空间按运动掩码重新组织为左右臂两组异步任务不再学习冗余的等待动作同步任务则保留双臂同时驱动。网络方面使用四层、隐维 $128$ 的 SIM(3) 等变 PointNet 编码器推理时用 DDIM 八步去噪替代最多一百步的 DDPM。附录给出的实现配置是每条手臂的观测为 13 维本体感知末端三维位置、旋转矩阵的两列、重力方向、夹爪开度动作为 7 维位置增量、轴角角速度、夹爪动作观测视野设为 1只用左臂初始状态右臂初始状态在每个任务内固定预测长度在严格异步任务取关键帧数 $K$、在同步任务取 $2K$点云采样 $1024$ 点对全部任务都足够增加到 $2048$ 点以上提升极小却显著增加存储与训练时间全部策略都可以在单张 RTX 3090 Ti24 GB上训练。实验设计与结果评测协议与硬件实验在五个真实双臂任务上做覆盖严格异步与双臂同步两类协作方式物体涵盖刚性、铰接、可变形与非抓取式四类。评测时每个物体做 2 到 5 次试验后三个任务共 30、25、20 次前两个任务的成对物体共 54、36 次物体的初始摆位随机。指标沿用 CALVIN 的做法报告每个子步骤的平均完成长度Avg. Len.最后一个子步骤即成功率。四个基线 ACT、Diffusion Policy、DP3 与 EquiBot 全部统一改为点云观测后重新训练模型保留最后一个 checkpoint 评测。任务关键帧子步骤平均时长 (s)增殖示范数pull drawer异步10642243pour water异步11653162unscrew bottle异步1255154uncover lid同步1232745open box同步1643536上表的示范数是几何变换扩增后的统计。需要说明的是关键帧的确定方式前三个异步任务可以很好地自动抽取后两个同步任务剩余关键帧过少因此在跨步较大的关键帧之间人工加密采样以保证动作平滑。图 6五个任务收集的被操作物体全部来自日常生活、未做定制。上排为倒水与拉抽屉任务的物体下排依次为拧瓶盖、揭盖与拆箱任务。数据采集效率为什么必须放弃遥操作采集方式操作员drawer (s)pour (s)unscrew (s)Master-Slave2204.8226.2247.9Drag Drop2100.7115.4123.6Auto-Rollout141.552.151.4Geo-Trans11.51.51.0自动重放用 1 名操作员就把单次采集时间压掉约 80%用于产出实机可验证的示范几何变换把采集从物理操作变成纯计算单次 1 到 1.5 秒是 500 倍量级扩增的唯一可行路径。代价也要说清楚这些示范的物理合理性由点云与关键位姿之间的对应关系保证而不是由真机验证保证。主结果76.8% 对 23.4%方法平均成功率↑Avg. Len.drawer↑Avg. Len.lid↑ACT5.7%2.131.28DP15.8%2.061.72DP319.4%2.801.96EquiBot23.4%3.541.96BiDP本文76.8%5.312.76在拉抽屉这个六子步任务上平均完成长度从 EquiBot 的 3.54 提升到 5.31最后一个子步骤的成功率是 54 次里成功 43 次即 79.6%。图 7五个双臂任务在真机上的执行可视化用不同颜色区分左臂、右臂与双臂动作帧箭头标注运动趋势。消融表示设计与数据多样性同等关键配置启用的策略成功率 / 平均长度id-1全部关闭≈ 原始 EquiBot24.1% / 3.54id-2纯物体观测48.1% / 3.80id-3稀疏关键帧51.9% / 4.15id-4纯物体观测 稀疏关键帧57.4% / 4.31id-5上述 重排动作空间61.1% / 4.48id-6纯物体观测 稀疏关键帧 几何变换77.8% / 5.15id-7四项全开79.6% / 5.31单项打开的收益都接近翻倍两项叠加到 57.4%而最大的跃迁来自几何变换增殖61.1% 直接跳到 77.8%。这说明表示设计与数据多样性缺一不可。图 8几何变换扩增倍率的影响243 条示范作为未扩增基线。成功率从 61.1% 升到约 79.6%平均长度从 4.48 升到约 5.3×100 之后趋于饱和。分布外泛化基线集体归零方法Avg.Len (drawer, 144)Avg.Len (lid, 36)成功率↑ACT0.250.600.0%DP0.750.750.0%DP30.880.850.0%EquiBot2.251.258.8%BiDP本文4.251.7035.0%分布外评测换成全新的物体摆位拉抽屉 144 次试验、揭盖 36 次。ACT、Diffusion Policy、DP3 的平均成功率全部归零长程任务的级联误差被分布偏移放大EquiBot 保留 8.8%因为它对整场景点云做 SIM(3) 等变增广仍然起作用但本文是显式改变物体几何训练分布更贴近真实的摆位变化。纯物体点云输入也让模型对场景冗余不那么敏感。手部轨迹质量的验证论文的第一个研究问题是提取出的手部动作质量如何。如果直接把 HaMeR 或 WiLoR 的三维手部网格中心点拿来用轨迹在相机空间里既不连续也不一致几乎无法解析把这些中心点投影回图像平面位置序列是平滑可信的说明误差主要来自深度与尺度而不是检测本身提升回三维并按关键帧压缩之后才得到连续一致、可以直接注入机器人的动作。结论是视觉误差靠简化与实机验证来吸收而不是靠更换更强的网格重建模型。图 9提取的手部运动轨迹对比。(a) 原始 3D 手部中心点(b) 投影到 2D 图像的轨迹(c) 提升为简化关键帧后的 3D 点。上排为 pull drawer下排为 uncover lid。任务与物体详解图 10五个长程双臂任务提取出的手部轨迹可视化可以看到每条轨迹中哪只手臂接触了哪个物体、以及动作的先后顺序。图 11被操作物体的厘米级尺寸信息第一部分。物体被抽象为长方体长宽高与圆柱高与直径两类典型几何。计数的细节是拉抽屉任务包含 9 件日常物件与 3 个抽屉倒水包含 6 个瓶子与 3 个杯子拧瓶盖包含 6 个瓶盖揭盖包含 5 个带盖盒拆箱包含 4 个快递箱前两个任务每个被操作物体设 3 个位置变体其余任务设 9 个。图 12用视觉基础模型Florence-2 开放词汇检测 SAM2 分割自动提取被操作物体。推理时先得到物体掩码再过滤出对应点云作为策略输入。失败案例图 13五个任务的代表性失败案例出错区域被框选并放大便于快速定位失效原因。失败集中在接触几何的细粒度对齐上而不是任务级规划物体在抽屉里放歪导致抽屉关不上、搬运途中物体碰到抽屉把抽屉推移出位、取物时抓偏导致物体没被抓起来、倒水时瓶口与杯口没对齐导致洒水、抓杯柄时接触点偏置导致移动中洒水。这与视觉提取误差和夹爪能力这两条限制是一致的。结果对比总结图 14结果对比总结Mermaid 图。关键发现五任务平均成功率76.8%次优基线 EquiBot 为23.4%差距 3.3 倍拉抽屉任务的末子步成功率为43/54 79.6%。消融显示单个策略就能把结果从24.1%提到48.1%纯物体观测或51.9%稀疏关键帧而几何变换增殖带来最大跃迁61.1% → 77.8%。数据采集成本差距悬殊主从遥操作单次204.8 秒、自动重放41.5 秒、点云几何变换仅1.5 秒一个示教良好的任务约8 小时可采集300 条示范。分布外摆位下 BiDP 仍有35.0%平均成功率是 EquiBot8.8%的四倍而 ACT、DP、DP3 全部为0.0%。关键位姿让动作可编辑严格异步任务按运动掩码删掉K |Ã| / 2个等待位姿动作空间重排把成功率从57.4%提到61.1%。表示层面的收益是稳定的五个任务的训练示范数分别是243、162、54、45、36条全部从一次示教增殖而来。局限性视觉提取仍有误差作者明确承认必须逐一在真机上核验提取出的位置与姿态是否可靠仍需额外人力。固定工作台初版 YOTO 使用两台固定机械臂可达空间受限灵活性与可及性不足未来考虑引入移动底盘。末端执行器能力有限所用平行夹爪不够灵活、功能受限这也是揭盖与拆箱这类任务只能采用非抓取式动作的原因。几何变换示范缺乏真机验证扩增示范的物理合理性依赖点云与关键位姿的对应关系而非实机执行确认。规模收益存在上限扩增倍率在 ×100 之后曲线趋于饱和继续堆数据不会带来线性提升。常见问题FAQYOTO 需要多少次人类示教一次。整篇论文的出发点就是教一次只用一个第三人称双目相机拍摄一遍人类双手示范从中提取关键位姿再靠自动重放与点云几何变换把这一次示教增殖成数百条训练示范。为什么要把连续手部轨迹换成关键位姿因为逐帧的手部轨迹不可信。WiLoR、HaMeR 这类三维手部网格重建在相机空间里既不稳定也不连续而关键位姿对误差不敏感论文的第一个研究问题验证了原始三维中心点难以解析、二维投影平滑、提升并离散化之后才连续一致。增殖出来的示范为什么可信两条路径各自保证一半。真机自动重放让动作在真实机器人上被验证保证可达与可执行点云级几何变换保证视觉观测在位置和物体类别上的多样性。代价是几何变换的示范没有经过真机确认其合理性由点云与关键位姿的对应关系保证。BiDP 和通用的扩散策略有什么不同三点观测从整场景点云缩到被操作物体点云1024 点预测目标是稀疏关键位姿而不是连续动作序列动作空间按运动掩码重排以去掉异步任务里冗余的等待动作。网络用 SIM(3) 等变 PointNet推理用 DDIM 八步去噪。为什么基线在分布外摆位下会归零因为长程任务的误差会级联。ACT、DP、DP3 在前几个子步骤就开始失败走到最后一步时已经无法完成因此平均成功率为 0.0%。EquiBot 依靠对整场景点云的 SIM(3) 等变增广保留了 8.8%而 YOTO 通过显式改变物体几何让训练分布覆盖了摆位变化因此还有 35.0%。这套框架能迁移到别的机械臂或任务吗论文的角度是框架与硬件解耦观测只需要一台双目相机动作以关键位姿与运动掩码表示策略只依赖物体点云。作者在五个长程任务之外还演示了两个新任务重定向笔、翻转编织篮的一次示教动作注入但初版仍使用固定工作台与平行夹爪迁移到移动底盘与灵巧手是作者列出的未来方向。参考链接论文 arXiv 摘要页arXiv:2501.14208项目主页含视频、数据集与代码入口hnuzhy.github.io/projects/YOTO代码与数据集仓库github.com/hnuzhy/YOTO数据集与预训练模型huggingface.co/HoyerChou/YOTO基线 ACT / ALOHALearning Fine-Grained Bimanual Manipulation with Low-Cost HardwareRSS 2023arXiv:2304.13705基线 EquiBotSIM(3)-Equivariant Diffusion PolicyCoRL 2024arXiv:2407.01479延伸期刊版本 YOTOTPAMI 2026hnuzhy.github.io/projects/YOTOPlus给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表