人形机器人走向真实作业 “全身智能”成为攻关方向

7月底,德塔智能发布头戴式全身全景数据采集设备Delta D1。佩戴者正常作业,设备即可同步采集第一人称全景视觉与全身关节运动轨迹,全程不依赖机器人本体,具身智能基础模型训练所需的全身交互数据由此规模化产出。

人形机器人走向真实作业 “全身智能”成为攻关方向

来源:新华网 2026-07-29 13:37
  • weixin
  • weibo
  • qqzone
分享到微信

7月底,德塔智能发布头戴式全身全景数据采集设备Delta D1。佩戴者正常作业,设备即可同步采集第一人称全景视觉与全身关节运动轨迹,全程不依赖机器人本体,具身智能基础模型训练所需的全身交互数据由此规模化产出。

双足人形机器人在变电站里穿过狭窄通道、伸手打开柜门,或者在车间里边移动边把零件放上传送带,需要同时协调双手、双腿、腰部和躯干,并在动作中持续保持平衡。这类能力被称为全身协同操作,是人形机器人从演示走向作业的关键环节。

成立于2026年1月的德塔智能,将该方向作为技术主线。该公司专注于人形机器人基础模型研发,旨在为双足人形机器人提供通用的“全身智能”能力。目前,其模型已在电网巡检、汽车零部件上下料、料箱分拣等工业场景中验证。

行业整体的重心也在转移。业内普遍认为,人形机器人正在从展示运动能力,转向完成可持续、可复制的真实作业。在真实作业场景中,节拍、成功率与连续作业时长等指标均需满足产线要求。

让机器人理解三维空间

要在真实空间中干活,机器人首先要理解所处环境。

当前主流具身智能模型的空间认知大多基于二维视觉表征。单目图像缺乏真实深度信息,仅凭像素估算距离易产生偏差。例如,机器人面对一扇门时,二维表征难以准确判断门把手的位置、开门方向及身体需预留的空间。此类误差在长时序连续作业中逐步累积,易导致任务中断。

德塔智能选择从底层表征方式入手,自研原生三维世界引擎,直接处理点云等三维场景数据,实现三维的理解、推理和对环境状态的推演。

理解空间之后,还需将任务意图变成动作。公司采用“大脑+小脑+力位混合”的分层架构:大脑负责环境感知与任务规划,小脑经仿真强化学习训练,将大脑的稀疏指令转化为全身电机的实时控制信号,再由底层的力位混合控制输出柔顺动作。

打破训练数据瓶颈

分层架构对数据提出了新要求。其中,负责理解与决策的“大脑”依赖真实交互数据训练,而仿真环境难以复刻柔性形变、多触点受力这类复杂接触。

“多数数采方案仅能采集手部等局部动作,基于此训练的模型难以完整理解人与环境的交互,也难以掌握攀爬梯具、推拉重型门等依赖全身协同的复杂任务。”德塔智能创始人兼CEO马晓健说。

目前行业普遍采用的采集方式有两类。一类是遥操作,由人穿戴设备远程操控机器人完成任务,数据精度高,但一名操作员一天只能采集数小时;另一类是手持或头戴设备记录人的操作过程,效率提高,但多数方案只覆盖上肢动作。训练数据如果只记录双手,机器人的下半身就成了盲区。

为解决数据来源问题,德塔智能自研了全身全景数据采集设备。采集者佩戴设备正常作业,设备同步记录第一人称视觉画面与全身关节运动轨迹,不依赖机器人本体,也不需要专门的动捕场地。此前,该公司与中国信息通信研究院合作发布工业数据集,由工人佩戴设备在真实产线上边作业边采集,生产不必中断。

同一套模型 不同的本体

不同厂商的人形机器人在自由度、尺寸、关节限位上差异明显,模型迁移并不容易。德塔智能沉淀了一套标准化适配流程,包括数据采集、跨本体运动重定向、小脑仿真强化学习与大脑微调,面对新本体不需要重新采集大规模数据、从头训练系统。

马晓健认为,随着产业化加速,算法模型企业与硬件主机厂的深度协同会成为主流模式:本体厂掌握硬件与场景入口,模型企业提供可持续迭代的智能能力,分工比各自包揽更有效率。

从技术路线到场景验证,人形机器人产业正在加快补齐基础能力。决定机器人能否真正有效执行任务的,是它对三维空间的理解精度,以及协调全身数十个关节的可靠性。

【责任编辑:李朋辉】
中国日报网版权说明:凡注明来源为“中国日报网:XXX(署名)”,除与中国日报网签署内容授权协议的网站外,其他任何网站或单位未经允许禁止转载、使用,违者必究。如需使用,请与010-84883777联系;凡本网注明“来源:XXX(非中国日报网)”的作品,均转载自其它媒体,目的在于传播更多信息,其他媒体如需转载,请与稿件来源方联系,如产生任何问题与本网无关。
版权保护:本网登载的内容(包括文字、图片、多媒体资讯等)版权属中国日报网(中报国际文化传媒(北京)有限公司)独家所有使用。 未经中国日报网事先协议授权,禁止转载使用。给中国日报网提意见:rx@chinadaily.com.cn
C财经客户端 扫码下载
Chinadaily-cn 中文网微信
×