2026年9月11日
科技

百万小时数据缺口下的具身智能:成本,路线与量产的三角博弈

2026年9月11日 信息差(早差)美股还能涨?中国第一。物价温和回升。算力租金大涨。土高物价。中弯道超车。二手房全款潮。中美AI博弈。美欧太空战。

一个简单的抓取动作,耗时超过四十分钟。据业内人士透露,在一次内部测试中,研究人员尝试用GPT-6操控机械臂夹取水杯,全程耗时长达40分钟到1小时。这个在演示视频里通常只需数秒的动作,暴露了一个被出货量增长所掩盖的事实:机器人的“身体”正在快速规模化,“智能”却远未准备好。

据中商产业研究院发布的《2026年全球及中国具身智能发展白皮书》(2026年8月),2026年全球人形机器人出货量预计达6.25万台,同比增长约247%,中国厂商出货量占全球八成以上。出货放量背后,产业竞争的焦点正从“能否动起来”转向“能否稳定完成任务并实现规模交付”。

[IMG:0]

数据的“天价”与“稀缺”

制约机器人走进真实世界的核心变量,不是算力,不是模型参数,而是数据——高质量、可规模化、能驱动精细操作的物理交互数据。

成本的数字令人却步。一条30秒的真机操作数据,采集成本在10到15元之间;采集1小时需要花费约1000元。要凑够20万小时的训练数据,投入将超过两亿元。而这20万小时,对于大模型预训练来说不过是“沧海一粟”。

若以百万小时量级的真机数据预训练为目标,投入成本将达到10亿元量级,难以支撑大规模模型迭代。据业内人士估算,全球具身智能有效积累的交互数据不足需求量的5%。

“没有10亿美金是卷不出来的。”一位从业者如此评价训练一个足够好的机器人“大脑”所需的投入。这句话背后,是算力、数据采集人力和场景资源的叠加成本。

不过,数据采集的效率正在被重新定义。鹿明机器人创始人喻超表示,其自研的FastUMI Pro系统将单条数据采集时长从50秒压缩至10秒,效率提升5倍,综合成本降至传统方法的五分之一。这种无本体数据采集方案打破了硬件壁垒,可快速适配市面数十种机械臂,有望缓解行业长期面临的“数据孤岛”问题。

分层还是统一:两条路线正在分岔

数据之外,另一个关键分歧在于模型架构。机器人“大脑”到底应该长什么样?2026年,这个问题被推到了台前。

分层架构是目前行业内规模最大的阵营。腾讯首席科学家张正友将具身智能拆为三个同时在线、运行频率不同的层级:负责空间理解的VLM、负责认知规划的RxBrain,以及负责动作转化的VLA,底层执行系统以500Hz至1000Hz运行。他对此的判断是,“分层在很长时间里面不太会变”,因为它对应的不是某一代模型的性能限制,而是物理世界本身存在的时间尺度差异。

智元联合创始人姚卯青持有类似判断。他指出,过去行业的主流思路是训练一个越来越完备的端到端世界模型,希望靠一个模型解决所有场景问题,但这一思路偏于理想化。更可行的方向是分层架构:上层由多模态大模型负责指令理解、任务拆分与失败重规划,下层由专门策略模型负责精细操作。

[IMG:1]

另一种声音同样不容忽视。它石智航联合创始人丁文超直言,“分层的大小脑是两个不相干的东西凑在一起”,认为VLA处理的是像素、轮廓这类视网膜级信息,无法提供对时间、空间、力和环境交互的物理直觉。逆矩阵科技创始人陈博远的判断则来自大语言模型的发展启示——垂类模型最终会被通用基座模型统一,物理世界也将遵循同样的规律。他主张构建一个理解人类物理直觉和本能的基座模型,能“all-for-one”地利用不同场景的数据。

两条路线的分歧本质上是工程问题:分层能否避免级联误差?统一模型能否获得足够的物理交互数据来训练?目前还没有定论。

量产已经启动,交付才是真正的考验

资本市场对具身智能的热情并不冷淡。据公开信息,智元机器人母公司最新公开投后估值为150亿元,2025年营收突破10.5亿元,较2024年增长近20倍。截至2026年6月,其累计机器人***量达1.5万台。

智平方在2026年6月完成近50亿元新融资,估值突破200亿元,成为粤港澳大湾区首个估值迈过这一门槛的具身智能企业。鹿明机器人则在5月连续完成A1及A2两轮融资,由三菱电机领投,累计融资近10亿元。

但融资热闹与商业闭环之间,仍有不小的距离。

据上市公司半年报数据,2026年上半年优必选营收12.69亿元,宇树科技营收11.52亿元,越疆科技具身智能机器人收入从上年同期的211万元增至4523万元,同比增长超过20倍。增长迅猛,但盈利仍是例外。据业内人士观察,“目前绝大部分具身智能企业还没有盈利,很多靠融资‘续命’”。

更深层的问题在于交付能力。行业分析指出,人形机器人目前主要买家集中在科研、展示和数据采集三类用途,而非真正进入产线“干活”。在2026世界机器人大会上,不少演示仍依赖工程师现场调试,动作完成效率和成功率距规模商用标准尚有差距。

[IMG:2]

智平方联合创始人张鹏在大会圆桌讨论中的表述颇具代表性:Demo和大规模商用之间,是一个漫长的探索过程。技术验证只是第一步,真正的规模化部署需要客户价值、硬件稳定性、生产体系、售后能力的全方位支撑。“现在大家都在摸索,还没有一条明确的路径出现。”

多位从业者提到了特斯拉的参照意义。特斯拉坚持纯视觉路线,用全球车辆数据迭代FSD,FSD的世界仿真数据集可以直接喂给Optimus,Optimus的真机物理数据也可以反哺FSD,Dojo超算同时为两个项目提供算力支持。这种“商业闭环中做数据积累”的路径,本质上是先有规模化商业部署,再由部署反哺技术迭代。而当前多数具身智能企业面临的是相反的局面:技术尚未成熟,商业场景也未能大规模打开。

姚卯青提出的问题值得行业思考:技术的发展、商业的闭环、规模化的部署,如何把这几者结合在一起?这个问题的答案,可能比任何单一技术突破都更能决定具身智能产业的走向。

本文由AI辅助生成

分享到: