比「算力荒」更致命,「数据荒」正在带来灾难?

发布时间:2026/7/29 3:35:16
比「算力荒」更致命,「数据荒」正在带来灾难? 作者郑施婧原创深眸财经chutou0325当下AI行业最常被提及的焦虑非算力短缺莫属。英伟达GPU一卡难求的新闻屡见不鲜价格也随之高涨。以H100为例市场价一度被炒至4万美元以上是其官方定价两倍以上同时交货周期拉长至数月。这种供需错配推高了AI企业的训练成本也让市场弥漫着焦虑的情绪。然而当我们把视线从大模型移至具身智能就会发现算力荒在这里更像“成长的烦恼”。更令从业者夜不能寐的是另一个早已降临的深层瓶颈“数据荒”。据行业测算要训练出具备通用泛化能力的具身模型需要千万甚至亿小时级别的真实操作数据而截至2026年初全球可用的高质量物理交互数据总量仅约50万小时缺口超过99%。这意味着具身智能当前的数据基础距离真正意义上的通用泛化能力还差两个数量级以上的距离。这不是渐进式的差距而是根本性的断档。具身智能已经撞上了一堵比算力短缺更难翻越的“数据荒漠”。01“算力荒”是工程问题“数据荒”是维度灾难过去摩尔定律让单芯片晶体管数量每18个月就能翻一番。算力成本持续下降英伟达H100的FP8算力接近2petaFLOPS相较五年前的V100单位算力成本大幅下降台积电CoWoS封装产能也在有序扩产月产能从2023年的约1.4万片晶圆在2025年提升至约7万片预计2026年底增加到13万片。如此来看算力瓶颈是产能问题有明确的扩产周期。但具身智能面对的是物理世界的无限复杂性这更像是一场维度灾难。首先就是数据无法被“爬取”。大语言模型可以吞噬互联网上人类千年积累的文本资料例如GPT-3就有约45TB数据。但机器人要理解物理世界却没有现成的“教科书”。单论“拧瓶盖”这个人类凭直觉完成的日常动作背后是物理世界的无数隐藏变量机器人需要理解瓶盖的材质、螺纹摩擦力等多变量。而这些变量恰恰是互联网这个“大模型粮仓”从未储存过的。所以当大模型用“文字”丈量世界时具身智能需要用“动作”来感知物理现实。这种性质上的差异让数据荒漠远比算力竞赛更为棘手。另外具身智能对数据“质量”的要求也远比大模型严苛。在大模型训练中错别字或语法瑕疵尚能处理。比如说GPT-3的训练数据里可能混入了像“偶今天真滴好开森”这种口语化、带错词甚至缺标点的句子但大模型依然可以从大量规范文本中提炼出主谓宾的规律学会正常的表达方式。而具身智能的数据规律就远不如文字清晰噪声的类型、严重程度、对模型的影响都难以定义。例如采集时摄像头帧率抖动、关节编码器延迟、力控传感器漂移等这些噪声不像文本错别字那样可以检索替换。鹿明机器人联席CTO丁琰就曾指出市面上大量UMI数据采集设备因硬件能力不足画面与动作无法严格对齐导致产出的数据根本“不具备进入训练管线的条件”。这意味着具身智能的数据采集从一开始就面临“质量门槛”低质数据不仅无法助力训练反而会污染模型。后者是“费力”前者则可能是“无用”。除此之外具身智能的数据还无法像算力一样迁移复用。例如英伟达的GPU架构从A100到H100能针对不同任务的计算效率持续提升模型训练可以无缝升级。但具身智能具有极强的硬件依赖性一台1.6米高的机器人与1.8米高的机器人在执行同样的“弯腰捡拾”动作时关节角度、重心偏移、抓握角度等可能完全不同。所以前者采集的数据对后者而言可能无效。这也导致具身智能数据之间有天然的隔离形成了一个个独立的“数据孤岛”。如此来看算力是可复用的标准化资源随着工艺进步和产能扩张其成本与获取难度必然趋近于下降而数据却是与特定硬件、特定场景深度绑定的“非标品”每一款机器人、每一次部署都可能需要重新积累。从本质差异上来看算力荒是暂时的、可解的而数据荒是长期的、结构性的核心瓶颈。02真机、UMI、仿真三路并进数据采集路线尚在突围面对“数据荒”的困境目前业界主要探索出三条技术路线即真机遥操作、无本体UMI采集、仿真合成数据。它们分别代表了精度、规模与成本的权衡但尚未有一条能完美兼顾三者。先来看真机遥操作。这是最早的方案通过VR设备、动捕服等遥操作真实机器人逐条记录动作数据。优点是数据真实度高、可直接用于同款机器人训练。例如宇树科技的基于轮式人形机器人G1-D的数采训练全栈解决方案其采集数据可直接用于同款G1-D机器人的模型训练。但代价同样惊人。北京人形机器人创新中心投资建设了近5000平方米的数采场地投入了120台机器人用于数据采集仅场地和设备投入就达数千万元。智元机器人建有大规模数采中心部署约200台机器人数百名数据采集员的轮班运营。场地、设备折旧加上人力薪酬构成了长期且高昂的固定支出。图源智元机器人目前来看真机遥操作好比手工精雕精度虽高但速度慢、花费大。这种模式或许更适合在高附加值场景如医疗手术、特种作业中担任主力数据源。如果要靠它撑起亿级数据的底座以目前机器人厂商的资金储备来看或许难以承担。UMI方案则将采集设备与机器人本体解耦用人手持轻量化的夹爪和摄像头在真实场景中操作采集。大衍科技就曾通过与无人超市、前置仓合作让工作人员佩戴采集设备正常上班在日常生活中就把数据采集了。如此UMI更像用上了半自动工具虽然仍需人力但采集速度快了不少花费也大幅下降。然而上海交大卢策吾团队却指出具身模型规模化卡在数据采集的“真实性与质量平衡”难题。具体而言UMI采用手持设备难以保证每次采集时摄像头角度、夹爪姿态的一致性导致数据格式不统一大规模采集后海量低质量数据需要大量人工后处理进行筛选和对齐反而可能使综合成本不降反升。如此来看UMI虽然降低了采集门槛却把数据质量的“雷”埋在了更隐蔽处。而仿真合成这条路则彻底抛弃真机直接在仿真引擎中生成海量训练数据。例如跨维智能开源的工具链EmbodiChain100%使用合成数据训练VLA模型且能直接部署于真实机器人实现了虚实迁移诺基亚联合英伟达基于Isaac仿真平台构建“AI数据飞轮”将智能体训练速度提升近10倍。但问题在于仿真毕竟是“仿”的。仿真环境再精细也无法完全复现现实生活。斯坦福大学《2026 AI Index Report》显示仿真环境下任务完成率可达89.4%但在真实家庭场景中骤降至约12.4%。这揭示了一个残酷的现实仿真训练出的模型在实验室里是“优等生”可一旦踏入真实世界的“考场”成绩便大打折扣。虚实鸿沟仍是仿真路线上绕不开的硬门槛。图源斯坦福大学《2026 AI Index Report》三条路线各有优劣短期内将在不同场景中并行探索真机遥操作守住精度上限UMI主攻规模化采集仿真合成负责覆盖极端场景。长期看UMI兼顾真实性与可低成本扩充规模或许是突破数据荒的主力。03陷入“囚徒困境”的数据采集与不明朗的行业最优解无论哪条路线似乎都卡在同一个死结上数据无法同时满足“规模、质量、成本”三角。每家公司都在投入却都走不远。面对如此困境从全行业理性角度出发或许最优解是将数据开源即共享数据、摊薄成本、避免重复采集。市场上已经有了先行者。乐聚牵头联合宇树、阿里云等共建国内首个国家级具身智能开源数据社区OpenLET已开源超6万分钟真机数据集供业界使用均普智能于2026年6月开源了面向真实机器人强化学习的大规模数据集RW-RL-Dataset。这些尝试为行业提供了宝贵参照也在证明数据共享在技术层面并非不可行。然而开源仍是少数派的理想主义更多企业选择了商业变现之路。京东将数据采集作为独立生意计划发动最多60万人参与两年内积累1000万小时视频数据并已上线具身智能数据交易平台首批定向开放2000小时高精标注“数据集”箸境智能在江苏省数据交易所完成全国首笔具身智能数据集交易包含约2.5万条结构化数据覆盖办公、商超、餐饮、家政四大场景鹿明机器人则打造了“数据超市”供客户在线采购标准化操作数据。星海图CEO高继扬就曾明确指出当前行业对于数据具有强烈的“私有化属性”。由此看来数据在当下更被视为企业的核心资产和可交易的商品而非开源的公共资源。图源LUMOS鹿明数据共享虽然能让全行业受益但商业逻辑下谁先开源谁就可能被对手低成本复制成果。于是这家不愿为别人作嫁衣那家担心对手反超。个体都保护自身利益最终导致全行业重复采集、效率低下。这正是经典的“囚徒困境”。共享是乌托邦式的理想现实却正滑向“各自为战”。目前来看除非出现强有力的行业标准与利益分配机制否则行业“最优解”可能将长期停留在愿景中。04从“数据喂养”到“自我迭代”数据“奇点”何时到来如果行业注定要各自突围那最有可能的方向是什么或许我们可以从大模型的进化中寻找启示比如让机器从“被投喂”走向“自主觅食”。大模型的发展已验证这条路径。英伟达研究团队开发的Eureka系统让AI能生成多个解决方案并自我筛选像程序员一样进行“自我批评”和改进。Eureka在83%的任务中超越人类专家使机器人性能平均提升52%Kimi K2则通过构建工具模拟器让智能体在“沙盒”中练习在与模拟环境的持续交互中积累经验并自我迭代。这两个案例的共同逻辑是智能体不再被动等待人类投喂数据而是通过与环境互动自主生成训练信号。或许可以借鉴这一逻辑通过某种机制实现具身智能的自我迭代。具身智能的“数据奇点”可能不在于数据量的堆砌而在于形成一个“采集→训练→落地→再采集”的闭环。上海创智学院与智元具身研究中心联合提出的LWD系统正是这一理念的实践。它让机器人在真实任务中持续积累交互经验包括成功轨迹、试错后的自我恢复以及人为引导的失败案例全部回传持续微调优化模型。通过这一机制LWD训练的单一通用策略在长程复杂任务中的平均成功率达到0.95远超传统行为克隆的0.76和离线强化学习基线的0.86。这一结果表明闭环迭代并非纸上谈兵而是已被验证的有效路径。循此思路可以设想一个场景机器人学会“扭瓶盖”后应用时遇到一个滑丝瓶盖经微调扭矩后成功拧开。这个“意外经验”被记录下来并回传模型更新后再部署给所有机器人。此后所有机器人都学会了处理滑丝瓶盖。扩展后每个机器人遇到的特殊状况都可以变成整个机器人群的共同经验。当跑通这个闭环或许机器人将不再依赖人类的持续投喂而是在真实世界的场景中自主进化。总而言之对于具身智能来说算力可以购买但物理世界的经验必须亲身积累。谁能率先让机器人在真实世界中跑通“自我迭代”的飞轮谁就将更可能定义下一阶段的行业格局。这场漫长的马拉松或许比的不是谁拥有更多GPU而是谁能让机器人更好地“理解”这个物理世界。