【你好,机器人】张全蛋这回从流水线上下来了,变成了机器人!
一个拧灯泡动作,暴露了具身智能的真实距离
北京亦庄的实验室里,一台人形机器人用五指灵巧手握住灯泡,缓缓旋入灯座。这个人类三岁孩童就能完成的动作,在它身上需要调动视觉定位、力觉反馈、姿态微调、接触判断等至少七个子系统协同工作。现场工程师盯着数据面板,神情没有轻松下来——就在十分钟前,同一个机器人刚刚以92%的成功率拧下灯泡,而反向操作的成功率骤降至36%。
这组来自Google DeepMind今年发布的Gemini Robotics 2实测数据,比任何行业宣言都更清晰地勾勒出当前具身智能的真实水位。据公开信息,该模型驱动的人形机器人已经能够完成持续数分钟、多步骤的复杂操作,双指夹爪在常规抓取放置任务中达到74%的成功率,精密插接任务可达90%。但一旦换成五指灵巧手,任务间的能力落差被急剧放大:扎紧垃圾袋44%,使用簸箕32%,封合密封袋40%。
“拧下来”和“拧回去”之间的56个百分点差距,指向的正是机器人产业当前最核心的命题:泛化能力。在2026世界机器人大会上,宇树科技创始人王兴兴给出了一个广为传播的标尺——如果一台机器人能在约80%的陌生场景中完成80%的任务,具身智能就迎来了自己的“ChatGPT时刻”。他预测这一时刻最快两三年,慢则五年甚至十年。
从固定产线到陌生房间:一场不同量级的考试
要理解这道标尺的分量,需要回到机器人技术演进的坐标系中。工业机械臂在过去四十年里证明了专项训练的极限——在固定产线上,经过充分调试的机器人可以把特定任务做到接近100%的成功率,速度与精度远超人类。但这类能力高度依赖结构化环境:物体位置已知、光照条件稳定、操作序列固定。一旦将同一台机器人推入一个从未见过的房间,仅凭一句“把厨房收拾一下”,它需要面对的是完全开放的物体识别、空间推理与实时决策问题。
大语言模型在2022年实现的突破,曾被许多人视为具身智能可以复制的路径。但两者面对的世界存在根本差异。语言模型处理的是高度数字化的Token序列,书籍、网页、代码皆可被统一编码,输出错误可以重新生成,对话可以追问纠正。机器人则被嵌入一个连续、动态、部分可观察的物理世界。塑料袋的形变、柜门半开的角度、光线的突然变化、宠物从脚边经过——这些在人类感知中被自动过滤的“噪声”,都可能让训练有素的动作序列瞬间失效。
更深层的鸿沟在于错误的代价结构。语言模型说错一句话,用户可以纠正后重新提问,系统状态不受影响。机器人若将玻璃杯的位置判断偏差三厘米,杯子碎裂在地,玻璃渣又构成新的障碍物,后续每一步都在被这次错误所改变的环境中进行。具身智能的闭环——观察世界、理解世界、决定行动、控制身体、改变世界、重新观察——每一步偏差都在沿链条传导,且无法像对话那样“清空重来”。
长链条任务的“大脑测试”:完美手脚也救不了规划能力
今年发布的LongAct测试集为这一困境提供了更精确的注脚。研究人员刻意将机器人最困难的低层运动控制剥离出去,只考察模型对长时序家务任务的理解与规划能力。也就是说,受测系统被假定拥有一双“完美的手和腿”,无需担心抓取失败或行走不稳,唯一要做的是想清楚“先做什么、后做什么、遇到意外怎么办”。结果令人清醒:当前顶尖模型的目标完成率仅为59%,完整任务成功率只有16%。
“把厨房收拾一下”这七个字,在人类听来清晰明确,但展开后可能包含几十甚至上百个子判断。什么该留、什么该扔、餐具放哪里、垃圾如何处理、不同形状的碗怎样归位——每一步都依赖常识、空间记忆与情境理解的高度协同。动作链越长,中间一次判断偏差的累积效应越明显。16%的完整成功率意味着,即便最优秀的大模型驱动,机器人在面对真实家务时仍有八成以上的概率在中途“走丢”。
这解释了为什么行业对“80%标准”的讨论正在分化。王兴兴的提法为长期缺乏统一尺度的机器人产业提供了一把直观的度量衡,把注意力从“会不会跑、能不能翻跟头”拉回到决定产业前景的核心指标上。但80%的任务完成率究竟是技术突破点还是安全门槛,取决于场景属性。聊天机器人答对80%的问题已经相当有价值,家庭机器人如果平均每五件事就有一件失败,独自照看老人或孩子的信任基础将难以建立。
两道门槛之间:从能力临界到信任临界
产业分析人士正在形成一种共识:机器人规模化落地需要跨越的是两道不同的门槛。第一道是能力临界点——机器人进入相对陌生的环境后,能听懂自然语言指令,自主拆解任务、规划步骤,完成相当比例的工作。80%这一数字大体指向这一层级。一旦跨过,人形机器人有机会从演示场景走向工厂、仓库、商场等半结构化环境的常态化部署。
第二道门槛更为苛刻,涉及行为可预期性。用户可以接受机器人偶尔犯错,但不能接受它在犯错时失控;可以接受它遇到不会做的事,但需要它明确知道自己的边界并主动求助。这背后的技术挑战不亚于提升成功率本身:机器人需要在执行过程中持续评估自身状态的可信度,在不确定性超过阈值时停止行动或请求人类介入。这种“知道自己不知道”的元认知能力,在当前主流模型中尚未形成系统性的解决方案。
从历史脉络看,机器人产业的演进轨迹与人工智能整体并不同步。大语言模型在数据规模与算力驱动下呈现出“涌现”式的能力跃升,而具身智能的每一次进步都被物理世界的复杂度严格约束。据业内人士观察,2025至2026年间多家头部企业的技术路线正在从“演示优先”转向“可靠性优先”,测试重心从舞台效果转向长时序任务的成功率与错误恢复能力。这一转向本身,或许比任何单一技术突破更能说明产业正在走向成熟。
Gemini Robotics 2数据中那些看似平庸的数字——扎垃圾袋44%、使用簸箕32%——恰恰标记着机器人进入家庭前必须攻克的真实高地。这些对人类而言近乎本能的小动作,背后是视觉、空间感知、力觉、常识判断、任务规划与实时控制的高度协同。当一台机器人能稳定地扎好垃圾袋、捡起桌角的药片、把不同形状的碗逐一放进洗碗机,并且明确知道自己什么时候做不到,它才算真正跨过了从“看着不错”到“可以托付”之间的漫长地带。
本文由AI辅助生成



