7.9
深览指数
科技腾讯新闻·机器人大讲堂··AI 生成
“采到老太太报警了”!那数据采集了,然后呢?
文章揭示了具身智能领域数据采集的深层困境:行业投入数百亿元建设训练场、采集海量数据,但真实家庭场景任务成功率两年仅提升不到2个百分点。核心矛盾在于,物理世界的数据采集链条存在严重断裂——从采集、清洗到模型有效性的转化率极低(采集12小时可用不到1.5小时),且数据标准不统一导致负迁移。文章认为,行业正在用高昂成本生产“物理世界经验的影子”,但Scaling Law在物理世界是否成立仍是未知数。适合关注具身智能、机器人产业投资或技术路线选择的读者,提供了产业链各环节的真实成本与效率数据。原文 ↗
核心观点
- ▍具身智能行业数据采集面临严重有效性危机:全行业投入数百亿建设训练场,但真实家庭场景任务成功率两年仅提升不到2个百分点,Scaling Law在物理世界是否成立仍是未知数。
- ▍数据产业链存在根本断裂:数据采集、清洗、标注、模型训练各环节缺乏反馈闭环,导致“数据飞轮”成为“数据黑洞”,大量采回数据最终消失在黑箱中。
- 01截至2026年初,可用高质量真实物理交互数据约50万小时,而行业估算达到70%-80%基础成功率需1亿小时,差距200倍;通用家庭场景成功率仅12%,2024至2026年提升不到2个百分点。
- 02一条30秒真机操作数据采集成本5-15元人民币,每小时约500-1000元;建设70多个训练场前后投入可能几百亿,但真实世界任务成功率几乎停滞。
- 03数据清洗损耗惊人:采集12小时真机数据,清洗后能用的行业高水平不超过1.5小时,有效率约12.5%;全球两万小时训练数据中有效数据不足三千小时。
- 04异构数据负迁移问题严重:20多个品牌20多万条数据混合训练效果一塌糊涂;香港大学团队研究显示跨本体预训练数据并非必要,甚至适得其反。
- 052026年上半年,25家中国具身智能数据创业公司合计融资超170亿元,但真正靠“卖数据”本身赚钱的公司几乎没有;底层采集员时薪仅7元。
- 06超过60%的公司选择直接删除至少一半此前花费重金采集的历史数据,因为早期数据质量差、格式不统一、与新模型架构不兼容。
反方 / 局限
- — 文章承认,工信部和市场监管总局已发布首个具身智能数据集质量标准和《人工智能具身智能数据质量规范》,但标准解决的是“怎么评价”,解决不了“怎么生产”,且头部企业已各自形成事实标准,中小企业只能被动跟随。
- — 文章指出,数据公司赚交付的钱、模型公司赚产品的钱、场景方赚效率的钱,三者利益不在同一个飞轮上,没有任何一方愿意为“别人的模型变好”买单。
15 分钟 · 5 卡片 · 11 资料
读原文 →