7月底,德塔智能发布头戴式全身全景数据采集设备Delta D1。佩戴者正常作业,设备即可同步采集第一人称全景视觉与全身关节运动轨迹,全程不依赖机器人本体,具身智能基础模型训练所需的全身交互数据由此规模化产出。
双足人形机器人在变电站里穿过狭窄通道、伸手打开柜门,或者在车间里边移动边把零件放上传送带,需要同时协调双手、双腿、腰部和躯干,并在动作中持续保持平衡。这类能力被称为全身协同操作,是人形机器人从演示走向作业的关键环节。
成立于2026年1月的德塔智能,将该方向作为技术主线。该公司专注于人形机器人基础模型研发,旨在为双足人形机器人提供通用的“全身智能”能力。目前,其模型已在电网巡检、汽车零部件上下料、料箱分拣等工业场景中验证。
行业整体的重心也在转移。业内普遍认为,人形机器人正在从展示运动能力,转向完成可持续、可复制的真实作业。在真实作业场景中,节拍、成功率与连续作业时长等指标均需满足产线要求。
让机器人理解三维空间
要在真实空间中干活,机器人首先要理解所处环境。
当前主流具身智能模型的空间认知大多基于二维视觉表征。单目图像缺乏真实深度信息,仅凭像素估算距离易产生偏差。例如,机器人面对一扇门时,二维表征难以准确判断门把手的位置、开门方向及身体需预留的空间。此类误差在长时序连续作业中逐步累积,易导致任务中断。
德塔智能选择从底层表征方式入手,自研原生三维世界引擎,直接处理点云等三维场景数据,实现三维的理解、推理和对环境状态的推演。
理解空间之后,还需将任务意图变成动作。公司采用“大脑+小脑+力位混合”的分层架构:大脑负责环境感知与任务规划,小脑经仿真强化学习训练,将大脑的稀疏指令转化为全身电机的实时控制信号,再由底层的力位混合控制输出柔顺动作。
打破训练数据瓶颈
分层架构对数据提出了新要求。其中,负责理解与决策的“大脑”依赖真实交互数据训练,而仿真环境难以复刻柔性形变、多触点受力这类复杂接触。
“多数数采方案仅能采集手部等局部动作,基于此训练的模型难以完整理解人与环境的交互,也难以掌握攀爬梯具、推拉重型门等依赖全身协同的复杂任务。”德塔智能创始人兼CEO马晓健说。
目前行业普遍采用的采集方式有两类。一类是遥操作,由人穿戴设备远程操控机器人完成任务,数据精度高,但一名操作员一天只能采集数小时;另一类是手持或头戴设备记录人的操作过程,效率提高,但多数方案只覆盖上肢动作。训练数据如果只记录双手,机器人的下半身就成了盲区。
为解决数据来源问题,德塔智能自研了全身全景数据采集设备。采集者佩戴设备正常作业,设备同步记录第一人称视觉画面与全身关节运动轨迹,不依赖机器人本体,也不需要专门的动捕场地。此前,该公司与中国信息通信研究院合作发布工业数据集,由工人佩戴设备在真实产线上边作业边采集,生产不必中断。
同一套模型 不同的本体
不同厂商的人形机器人在自由度、尺寸、关节限位上差异明显,模型迁移并不容易。德塔智能沉淀了一套标准化适配流程,包括数据采集、跨本体运动重定向、小脑仿真强化学习与大脑微调,面对新本体不需要重新采集大规模数据、从头训练系统。
马晓健认为,随着产业化加速,算法模型企业与硬件主机厂的深度协同会成为主流模式:本体厂掌握硬件与场景入口,模型企业提供可持续迭代的智能能力,分工比各自包揽更有效率。
从技术路线到场景验证,人形机器人产业正在加快补齐基础能力。决定机器人能否真正有效执行任务的,是它对三维空间的理解精度,以及协调全身数十个关节的可靠性。