据傅利叶消息,加州大学伯克利分校的研究团队提出了一套创新方案,通过模块化遥操作数据采集结合名为“选择策略”(Choice Policy)的机器学习方法,成功提升了人形机器人(886069)在复杂非结构化环境中执行长序列任务时的全身协调能力、成功率与鲁棒性。该方案在洗碗机装载和白板擦拭两个真实场景任务中得到了有效验证。
一、新的方案思路
针对当前人形机器人(886069)在全身协调控制上面临的挑战,研究团队提出了结合模块化遥操作接口与可扩展学习框架的解决方案。
1. 模块化数据采集
研究团队将遥操作的全身控制拆解为四个核心技能模块,以降低操作复杂度、提升数据质量:
- 手部操控:采用分组协同与独立控制策略,实现细粒度运动与抓握力调节。
- 臂端操控:为单臂操作优化,支持动态重置工作空间,便于执行大范围连续运动。
- 移动策略:基于速度条件强化学习,实现高频移动控制,并能与操作模式无缝切换。
- 手眼协同:引入“主动跟踪模式”,使头部摄像头自动跟随操作手,减少视觉遮挡。
该模块化设计使操作者能在短时间内掌握复杂任务操作,并兼顾了数据采集的表征力与模型学习的灵活性。
2. 新的学习策略-选择策略(Choice Policy)
选择策略包含特征编码器、动作提议网络与评分预测网络。其核心流程是:首先生成一组候选动作轨迹,然后预测每条轨迹的置信度分数。训练时采用“胜者通吃”策略,仅用最优轨迹更新网络;推理时则执行评分最高的轨迹。该方法能有效捕捉演示中的多模态行为,并通过单次前向传播实现快速推理,满足实时控制要求。
二、实验验证
研究团队设计了“将盘子插入洗碗机”和“白板擦拭”两个任务进行验证。
1. 任务一:将盘子插入洗碗机
使用傅利叶GR-1机器人,对比了选择策略、行为克隆及扩散策略的表现:
- 在双手传递和插入洗碗机等高难度多模态决策环节,选择策略的成功率(分别为90%和70%)显著高于行为克隆和扩散策略(传递成功率70%,插入成功率50%)。
- 当面对不同颜色和位置的盘子时,选择策略训练的机器人也展现出更强的鲁棒性。
2. 任务二:白板擦拭
使用Robotera Star-1机器人进行测试(扩散策略因推理速度慢未用于此任务):
- 选择策略在抓取白板擦、移动可靠性和擦拭成功率上均优于行为克隆。
- 行为克隆常因最终定位不准导致擦拭失败。
三、实验结果与结论
实验表明,经模块化遥操作系统和选择策略训练的人形机器人(886069),在长序列、高难度操作任务中表现出更高的成功率和更强的鲁棒性。该方案为复杂任务中的人形机器人(886069)协调控制提供了有效思路。
研究团队也指出,当前方案的视觉感知泛化能力仍有局限,未来将通过引入更多样化数据或预训练来提升鲁棒性;同时,手眼协调策略也将探索更自适应的学习机制以替代现有固定规则。
原文:技术圈 | 模块化遥操+“选择策略”机器人“学会”全身协调(来源:傅利叶)
