|

财经

机器人进居民楼采数据 具身智能面临数据饥渴困局

来源:大湾区经济网

2026-09-05 16:28:24

(原标题:机器人进居民楼采数据 具身智能面临数据饥渴困局)

大湾区经济网9月5日讯 “得大脑者得大脑,得数据者得大脑”——智能机器人行业正在经历一场严峻的“数据饥渴”。据财闻报道,北京某头部具身智能企业为获得家庭场景数据,在和居民协商一致后,带着录像设备进入北京居民家中采集数据。“刚开始居民觉得新鲜,很配合,但数据采集效率极低,需要不断重复,后边居民开始'烦了'。”该人士透露,“我们带着团队去北京老旧小区敲门,采到老太太都要报警了。”

图片为AI生成。

数据采集的难度远超想象。机器人需要多模态数据——摄像头拍的画面、关节转动角度、手指施加的力,必须同步记录,任何一秒的偏差,整段数据作废。采集只是起点,十万小时的原始视频经过清洗、标注、重建,真正能用来训练的可能只剩几千小时。“采集12个小时,清洗出来能用的,超过1.5个小时就谢天谢地了,这已经是行业最高水平。”而训练一个好的机器人大脑,至少需要百万小时级的真实交互数据,目前行业能用的只有十万小时级,数据缺口超过500万个小时。

缺口之下,行业开始出现数据交易。有人戴着头戴设备在真实环境里采集“异构数据”,以7元一小时的价格卖给机器人公司。但不同品牌的硬件构型不同,采集的数据格式也不统一,“数据孤岛”现象严重。稍早前,宇树科技创始人王兴兴判断,泛化能力不够是当前机器人大脑能力的最大瓶颈。银河通用创始人王鹤也认为,当前具身基础模型能力大约相当于GPT-2阶段,2028年前后才可能迎来关键突破。

国内头部公司正各自搭建“数据工厂”。智元机器人在上海自建数据采集工厂,部署约200台机器人同时作业,2024年底开源了全球首个基于真实场景的百万真机数据集。宇树科技走开源路线,将人形机器人全身遥操作数据集放上Hugging Face,包含340小时、189万条动作轨迹。星海图坚持真实数据路线,发布了VLA基础模型G0.5。银河通用则走“仿真合成数据预训练+真实数据对齐”的路子。整个行业正处在“先建基础设施”的阶段,算力、人工、本体三样都在烧钱。

大湾区经济网

2026-09-05

首页 股票 财经 基金 导航