Galbot亮相WRC:敏捷人形机器人能跳舞,但能干活吗?

Galbot在WRC的高光时刻
在世界机器人大会(WRC)上,中国机器人公司Galbot(银河通用)展示了其新一代敏捷人形机器人,凭借流畅、灵活的运动控制引发了广泛关注。
世界机器人大会(World Robot Conference)是由中国电子学会等机构主办的全球性机器人领域盛会,每年在北京举办,汇聚全球顶尖机器人企业、科研机构和行业专家。WRC通常包含论坛、博览会和机器人大赛三大板块,是观察全球机器人技术趋势和中国机器人产业发展水平的重要窗口。近年来,随着中国在人形机器人领域投入的大幅增长,WRC已成为各厂商发布新品、展示技术实力的核心舞台。
银河通用(Galbot)是近年来崛起的中国人形机器人创业公司,专注于通用人形机器人的研发。公司在运动控制、机器人感知和AI决策等方面进行了深入布局,其技术路线强调将强化学习与传统控制理论相结合,以实现更自然、更鲁棒的全身运动能力。从工程视角来看,实现如此高水平的动态平衡与运动控制是极其困难的技术挑战,而Galbot的确交付了令人印象深刻的成果。

然而,在Reddit社区的讨论中,一个尖锐的问题被反复提出:炫目的敏捷动作固然吸睛,但如果人们要真正掏钱购买一台机器人,它必须能够完成实际工作,而不仅仅是在展台上跳跃、舞蹈几分钟。
技术难点与市场需求的错位
这场讨论揭示了当前人形机器人行业一个耐人寻味的现象:看似最炫技的动作反而不是最难的部分。
舞蹈:脚本化的表演艺术
有社区用户敏锐地指出,机器人跳舞之所以看起来惊艳,本质上是高度脚本化的表演,并不需要对环境进行动态适应。机器人的脚本化运动(scripted motion)是指预先编排好每一帧的关节角度或运动轨迹,机器人按照既定程序精确执行,类似于工业机器人在产线上的重复作业。这种方式在受控环境下可以产生非常流畅、美观的动作效果,但机器人并不需要理解自身动作的语义,也不需要根据外部环境的变化做出调整。与之相对的是自主运动(autonomous motion),机器人需要通过传感器感知环境、理解任务目标,并实时生成运动策略。两者之间的技术鸿沟巨大:前者本质上是回放问题,后者则涉及感知、规划、决策和控制的完整闭环。
这与大语言模型(LLM)的发展路径形成了有趣的呼应——人们最初以为艺术创作是AI最难攻克的领域,结果它反而比结构化、程序化的任务更早被模拟出来。
换言之,能让机器人优雅起舞的运动控制,虽然在工程上难度极高,但它是一个相对封闭、可预设的问题。真正的难题在于开放环境下的通用作业能力。
从平衡到作业:不断移动的评价标杆
讨论中一位用户提出了一个发人深省的观点:
"曾几何时,人们普遍认为机器永远无法解决双足平衡问题。而如今双足平衡已经司空见惯,人们甚至不再为之惊叹。很快标准就会变成——'它们能叠衣服,当然可以,但如果不能从零裁剪一套西装,我可不觉得有什么了不起。'"
双足动态平衡是人形机器人最基础也最核心的技术挑战之一。与四足或轮式机器人不同,双足机器人的支撑面积极小,重心高,天然处于不稳定状态。实现稳定行走需要实时求解复杂的动力学方程,涉及零力矩点(ZMP)控制、模型预测控制(MPC)、全身动力学优化等技术。近年来,强化学习(Reinforcement Learning)的引入让机器人能够在仿真环境中通过数百万次试错学习出鲁棒的平衡策略,并通过sim-to-real(仿真到现实)迁移技术部署到实体机器人上,这极大地加速了双足平衡技术的成熟。波士顿动力的Atlas、特斯拉的Optimus以及国内的多家企业都在这一领域取得了显著进展。
这恰恰点出了人形机器人评价标准的"移动靶心"效应。每当一项曾被认为不可能的技术被实现,公众的期待就会迅速抬高,此前的成就便被视为理所当然。
"温水煮青蛙"式的技术演进
有评论者将当下的技术演进比作"温水中的青蛙"——我们或许早已身处技术奇点的进程之中,只是没有一个明显的起点标志。
从图灵测试的早期讨论,到几十年前科学美国人(Scientific American)节目中那些当时看来新奇、如今却显得极其简陋的技术演示,技术进步的累积效应往往在回望时才显得震撼。
对于人形机器人而言,接下来的几年将是关键窗口期。正如社区讨论所言,一旦世界任务模型(world task models)与安全机制趋于成熟,人形机器人将逐步走入人们的日常生活。世界任务模型是近年来机器人学和AI领域的前沿概念,指的是让机器人拥有对物理世界的通用理解能力——包括物体的物理属性、空间关系、因果推理以及任务执行的长程规划能力。这一概念与Yann LeCun提出的"世界模型"(World Model)理念相呼应,强调AI系统需要建立对现实世界运作规律的内部表征,而不仅仅是在特定任务上做模式匹配。在机器人领域,世界任务模型意味着机器人能够在从未见过的新环境中,根据自然语言指令或高层目标,自主分解任务、规划动作序列并处理执行过程中的异常。谷歌的RT系列模型、丰田研究院的扩散策略(Diffusion Policy)以及多家初创公司正在探索的视觉-语言-动作(VLA)模型,都可以看作是迈向世界任务模型的早期尝试。
营销工具还是生产力工具?
讨论中还有一个务实的观察:目前跳舞恰恰是这类机器人最主要的应用场景之一——作为一种营销手段。
有用户直言,一台会跳舞的机器人比展台上穿着暴露的模特更能吸引眼球,为产品带来关注度。这句略带调侃的评论背后,折射出行业的现实:当前的人形机器人仍处于"展示技术能力"而非"创造实际价值"的阶段。
叠衣服门槛:通用操作的试金石
多位社区成员不约而同地提到了"叠衣服"这个看似简单的任务。"等它有能叠衣服的手部灵巧度了再来找我"——这句话代表了怀疑者的核心诉求。
叠衣服之所以成为人形机器人的衡量标准,是因为它需要:
- 对柔性、非刚体物体的感知与操控
- 对不确定环境的动态适应
- 精细的手部灵巧度与力控
柔性物体(如衣物、绳索、食品等)的机器人操控是公认的机器人学难题之一。与刚性物体不同,柔性物体具有无限维度的形变自由度,其形状在操控过程中会持续变化,且难以用简单的数学模型精确描述。这意味着传统的基于精确模型的抓取和操控算法几乎无法直接适用。此外,柔性物体的感知也极具挑战——由于自遮挡严重、形态多变,视觉系统很难准确估计其完整的三维状态。目前的研究方向包括基于学习的操控策略、触觉传感器的应用(如GelSight等光学触觉传感器提供接触面的高分辨率信息)、以及将大规模预训练模型与操控策略结合的方法。尽管学术界已取得不少进展,但在非结构化家庭环境中可靠地叠衣服、整理床铺等任务,仍远未达到商业化水平。
而在手部灵巧操控方面,灵巧手(dexterous hand)是人形机器人实现通用操作能力的关键末端执行器。人类的手拥有约27个自由度和数千个触觉感受器,能够完成从精密装配到柔性操控的极广范围任务。机器人灵巧手的设计需要在自由度数量、驱动方式、传感密度和成本之间做出权衡。当前主流的灵巧手方案包括电机直驱、腱绳驱动和液压驱动等。力控(force control)则是灵巧操控的核心能力之一,要求机器人能够精确控制与物体之间的接触力,而不是仅仅控制关节位置。在叠衣服等任务中,机器人需要同时协调多指的位置和力度,在保持对衣物的稳定抓持的同时完成折叠动作,这对传感器精度、控制算法实时性和硬件可靠性都提出了极高要求。
这些正是当前机器人技术最薄弱的环节,也是从"表演"迈向"作业"必须跨越的鸿沟。
结语:敏捷之外,人形机器人的真正价值在哪里
Galbot在WRC的展示无疑证明了中国机器人企业在运动控制领域的实力。但整场社区讨论的共识在于:运动的敏捷性是必要条件,而非充分条件。
真正决定人形机器人商业化前景的,是它能否可靠地完成有经济价值的实际工作。行业的下一个里程碑,不会是更炫目的舞蹈,而是那些平凡却困难的日常任务——叠衣服、整理房间、处理复杂环境中的操作。
当机器人不再需要靠跳舞来吸引眼球,而是靠实实在在的劳动价值赢得市场时,人形机器人产业才算真正走出了"表演时代"。
相关推荐

16岁入门机器学习:从零到实战的完整学习路径
一位16岁英国A-Level学生如何从零入门机器学习?本文提供清晰的学习路径规划,涵盖Python基础、数学衔接、推荐资源、实战项目建议,帮助高中生高效开启机器学习之旅。

用JavaScript打造GitHub Action文本替换工具:从原理到实战
详解如何用JavaScript开发GitHub Action文本替换工具,涵盖实现原理、应用场景与关键技术细节,助你掌握CI/CD自动化流程中的文本处理最佳实践。

Coze扣子入门教程:零基础搭建AI智能体的完整认知指南
详解字节跳动Coze扣子平台是什么、国内版与海外版核心区别、免费使用GPT-4的方法,以及零基础如何通过低代码方式搭建AI Bot智能体并实现商业落地。