mt logoMyToken
ETH Gas
EN

逛完2026世界机器人大会,具身智能行业最该回答的5个问题

Favoritecollect
Shareshare

图片

没来的一定要看,来了的不看等于白来。

作者:白石、周永亮, 极客公园

编辑:周永亮 李源

8 月 19 日,北京亦庄的空气里飘着一种奇怪的兴奋,这是 2026 世界机器人大会开幕的日子。300 多家企业、2000 多件展品,几乎把具身智能行业能拿出的东西都搬到了这里:大模型、本体、关键零部件、数据,应有尽有。

开幕当天,宇树科技敲钟上市,盘中市值一度冲破 4000 亿元,这可能是过去十年,中国机器人行业最接近「资本狂欢」的一天。过去,机器人公司更多活在实验室、融资新闻和 Demo 视频里;而宇树的上市,第一次给这个仍处在早期的赛道钉下了一个资本锚点。

除此之外,云深处科技进入交易所受理或审核环节;智元机器人则于 2026 年 7 月确认启动赴港上市流程。一级市场的热,正在向二级市场传导,具身智能不再只是技术想象,也开始被要求回答收入、交付、毛利和规模化的问题。

逛完整个展区,跟我们此前预料的一样,今年没有让所有人「哇」的时刻,更多的是 demo 的展示。宇树没有展示刚刚发布的、原地跳高 2 米、奔跑速度 12.66 米/秒的「超人」,展台上更多是已有产品在解锁新动作;众擎把八角笼搬进了会场,维他动力用二次元偶像的方式整活……热闹是真热闹,但很少有人再讲「颠覆性突破」这四个字了。

比起继续追问「什么时候会有奇迹」,更值得追问的是几个更朴素的问题:机器人是不是只能长成人的样子?具身智能的「通用性」到底走到了哪一步?数据,正在从一门算法生意,变成一门硬件生意吗?那些藏在指尖、关节和电机里的关键部件,又往前走了几步?

带着这些问题,我们在展馆里走了一圈,也和多家代表性公司深聊。它们不一定都最会制造声量,却分别代表了这个赛道正在发生的关键变化:本体形态的分化,通用模型的竞争,数据闭环的重构,以及关键零部件逼近「最后一厘米」。

银河通用的展台上,轮式、重载和双足三种完全不同形态的机器人,跑的是同一套具身基础大模型;维他动力反过来从真实使用场景出发,倒推出了它的第一款人形机器人 Vbot ATOM;自变量在物流分拣场景里,把效率做到了每小时 1816 件、准确率超过 98%;帕西尼,则把解决「触觉」的技术方案,扩展成了覆盖全身的感知网络……

具身智能仍然早期,甚至比很多人期待的更早期。它正进入一个更艰难、也更有价值的阶段,谁能把模型、本体、零部件和工程能力形成一个闭环,谁才可能成为下一阶段真正有价值的公司。

01、机器人是不是只能是人形?

过去两年,具身智能的叙事被人形机器人高度占领:跳舞、跑步、打拳、马拉松,所有出圈事件几乎都长着一副人的样子。

但看完这届 WRC,你会发现,人形机器人的概念依旧延展,巨型、仿生、半人马……「像人」不再只有一种标准答案。与此同时,在人形之外,越来越多公司开始根据真实任务重新设计机器人形态。 (*注:视频可在原文链接中查看)

今年 WRC 逛下来,宇树的人形这边确实拼得凶,带来了全新的格斗动作。G1 打格斗,组合拳、回旋踢、飞踢一套下来,靠的是全身关节的实时协调;H2 个头更大、关节输出更强,出拳抬腿更有分量感。两台机器人放一起看,正好是「灵活」和「力量」两种风格。

乒乓球互动也很值得一看,机器人得先「看懂」来球再决定怎么回,这比单纯耍套路更考验感知和决策的配合。加上全身遥操作格斗系统,操作者的动作能被精准复现,这套东西背后其实是宇树在攒具身智能的数据闭环。

但最显眼的还是 GD01,那台三米高、能载人变形的机甲。它不是人形,也不是传统四足,而是把机器人技术和装备形态揉在了一起,直接冲着文旅、特种作业这类场景去的。

在本届 WRC 上,Vbot 维他动力正式发布人形具身智能终端 Vbot ATOM,并同步开启预订。ATOM 值得注意的是,它并不是从概念样机起步,而是承接了 Vbot 在四足机器人「大头」上已经验证过的产品定义、量产交付和用户运营能力。

今年 5 月,AI 载物机器狗「大头」实现量产交付。到目前为止,这款产品已成为消费级具身智能销量第一,在真实世界中累计完成 126 万次大模型交互、23,700 公里用户伴随里程和 131,500 小时陪伴,过去三个月还完成了 4 次 OTA。对具身智能行业来说,这组数据的意义不只在于销量,而在于它证明 Vbot 已经让机器人进入真实用户生活,并形成了从交付、使用反馈到持续迭代的产品闭环。

基于「大头」的实践,Vbot ATOM 没有沿用传统工业人形机器人的思路,而是从家庭、零售、公共空间和办公服务等生活场景出发,反向定义产品形态。160cm 身高、180cm 臂展、95cm 腿长和 31 个本体自由度,决定了它具备接近真人尺度的服务能力;织物包覆、状态交互设计和静音足底,则让它在家庭和公共环境中显得更友好,也更容易被人接受。

技术层面,Vbot 还发布了「Vbot Embodied Genome|具身基因组」具身模型体系及三大核心模型,用于支撑交互理解、世界模型决策、跨本体进化和真实反馈回流。

由此来看,Vbot ATOM 的到来,不只是 Vbot 从四足机器人延伸到人形机器人,更意味着其正在把已经验证的产品化能力,带入更大的生活空间,推动人形机器人从本体展示走向产品化时刻。

未来不远机器人则完全围绕家庭需求设计,能够完成基础的家务,儿童陪伴,老人陪护,宠物照料等场景。目前他们已经进入 500 多个付费家庭,累计服务超过 5 万小时。

未来不远机器人还展示了他们在家庭场景的快速迭代能力,一个月前的 WAIC,它重点展示的是洗衣,叠衣,收纳等基础家务,而在 WRC 现场,则把场景扩展到厨房:搭载了全新一代自进化 WAM 世界动作模型的第二代全栈自研机器人本体 F2 端到端自主完成意面制作。

完整烹饪流程对机器人的协同能力、精准度、判断力要求极高:需要双臂高精度同步协同;应对不可逆流体操作,依靠视觉瞬时精准判断用量;同时需要灵活切换、抓取、置换多种厨具,还要自主学习翻炒火候等无标准答案的「人性化分寸感」。而未来不远机器人在现场不中断的连续烹饪展示了他们惊人的稳定性。

未来不远表示,他们从本体、大脑到硬件采取软硬件协同的全栈自研,因此在新场景的迭代更快。除了从轻家务逐步向重家务扩展,未来不远对于家庭场景需求的理解还包括覆盖儿童、老人和宠物的刚需场景,现场他们也展示了包括五子棋,象棋的各种棋类的操作,开饮料,互动类游戏,以及双机协同工作等等。极强的落地场景和互动性让他们的展位始终围满了人群。

自变量机器人目前的重点是家庭和物流两个场景。其中物流场景它没有用完整人形机器人和五指灵巧手,而是两条机械臂配合普通夹爪,处理形状、重量和材质随机的真实包裹。

它的机器人会根据包裹本身的物理特性决定怎么处理:小件直接抓取,重箱可以推,碰到没有面单的玩具熊等异形件,也会判断后续流程并自主处理。此前公开直播中,这套系统连续运行一小时,分拣效率达到 1816 件/小时,准确率超过 98%。

自变量在现场采访中强调,它的机器人已经进入实际应用:家庭机器人已经大规模服务用户家庭;物流分拣也已经进入头部企业。

02、具身智能的通用性走到哪一步了?

具身智能的通用性,或者说通用任务能力,指的是具身智能机器人是否能跨物体、跨环境、跨指令完成复杂任务,以及是否能在新场景里重新规划。

从能力上,具身智能在通用性上已经跨过「单一动作展示」阶段,现在先进的机器人,能够完成多技能串联、状态跟踪,甚至可以在经历扰动后重新进行规划。

在智能上,具身机器人的通用性显然与模型有关,而目前模型的技术路线远未收敛。头部公司们开发的路线有端到端 VLA(视觉—语言—动作模型),WAM(世界动作模型),分层具身智能体操作系统,以及跨本体具身基础模型等。

其中,端到端 VLA/WAM 的代表是银河通用、千寻智能和未来不远。这一思路的共同点是尽量将视觉、语言、动作和部分状态预测放入统一模型或表征中。

银河通用在 WRC 发布的双足人形机器人 Galbot ET1「银河·星仔」,它利用 Agent 互动自学习技能可以直接观察人的动作,再实时模仿舞蹈和高动态动作,它还集成银河通用「LATENT」高动态网球对抗规控运动学习框架,可实现真人感网球陪练。

支持 ET1 实时模仿舞蹈和打网球等连续拟人动作的,是 AstraBrain WBC,即银河星脑体系中负责全身实时运动控制的小脑基座模型。

具体来说,舞蹈演员给出新的动作,ET1 通过视觉识别并提取人的实时运动轨迹,再把动作映射到自己的身体上。它是真的在实时模仿,不是从预先编排的动作库里挑出一条轨迹重新播放。

银河通用目前有双足人形机器人 Galbot ET1,还有 Galbot G1、S1 等不同形态的机器人。它强调用「一颗大脑跨本体、跨任务、跨场景」。这些的机器人在家庭、零售和工业这些场景都有各自的应用,但它们共享同一套具身智能基础模型,不同形态的机器人,拥有各自的运动控制系统,感知、任务理解、世界建模和行动规划能力却是可复用的。

银河通用在接受采访时提到,过去机器人进入一个新场景,往往需要围绕这个场景重新采集数据、重新训练;现在同一套基础模型已经开始在不同本体和任务之间复用。通过少量数据进行适配,轮式机器人能用,重载机器人能用,换到双足机器人上,大脑也不需要重新从头训练。

未来不远此前基于 AVLA 构建视觉、语言与动作的端到端闭环,并在此基础上进一步推出 Self-Evolving WAM(自进化世界动作模型),让机器人不仅能够理解并执行任务,还能预测动作结果,并利用真实家庭中的执行数据持续迭代模型。

未来不远表示,以洗衣场景为例,其模型基于几十种洗衣机进行训练后,已经可以泛化到数百种不同的机型、开门方式和按钮类型。类似的泛化能力也用于衣物,玩具等家庭物品,让机器人能够在不同家庭环境中完成动态变化的任务。

自变量重点展示其模型 WALL-B 的通用性:家庭服务和物流分拣两个差异很大的场景,运行的是同一个模型。WALL-B 将视觉、语言、触觉、动作和物理预测融合进统一网络,让机器人理解重力、惯性、摩擦等物理规律,并预判动作结果。

分层式具身智能架构的代表性探索包括逐际动力 COSA。

COSA 0.5 将机器人大脑分为三层:System 2 负责场景理解、记忆、推理和任务调度,System 1 调用 VLA 等操作技能,System 0 以最高 1000Hz 进行全身运动控制。

图片

跨本体具身基础模型的代表之一是星海图 G0.5。WRC 现场,搭载 G0.5 的 R1 Lite 在移动过程中完成任务整理需要的环境理解、任务拆解、双臂操作和异常恢复。G0.5 通过统一动作编码,让同一套模型适配不同机器人本体。

图片

千寻智能用它的 Moz1 挑战长程任务,比如「整理餐厅」,机器人接到一句指令后,要连续完成环视环境、取可乐、移动到冰箱、开门放入、关门,再把脏碗送进洗碗机等一系列动作;如果目标物被移走、遮挡,或者已经整理好的环境再次被打乱,它还会重新感知并规划。

在应用场景上,让机器人像人一样进入家庭和公共空间,完成复杂任务,现在的成熟度还相对不足,尤其是涉及与人直接交互,需要考虑安全性。但在工厂、在仓库、以及其他相对封闭的场景,机器人已经能完成一些相对复杂的长程任务。

例如,星动纪元的星动 M7 在现场连续完成随机包裹识别、抓取、翻转面单和送入传送链路等动作;这套能力已经在中国邮政等物流中心落地,最高达到每小时 1200 件。

具身智能的通用能力和垂直场景能力并不互斥,机器人在真实世界的垂直场景中,适应各种非标操作,并且能稳定运行,其实可以反哺通用能力的提升。

而且,各家公司在模型进化上的努力,都是从单项技能向跨本体、长程任务和动态环境泛化等方向进步。

03、具身数据正在变成一门硬件生意吗?

无论具身智能的通用性能,还是垂直场景性能,模型都需要大量高质量的数据。

机器人的数据采集,目前主流的方式有遥操作、 无本体 UMI 与数据手套、第一视角采集与动捕、真机本体采集等,几乎每一种,都涉及硬件,有人笑称,具身智能的数据采集,是不是变成了一门硬件生意?

其实数据的重要性不在数据本身,而在于模型,在于智能。只有当数据足够多,足够高质量,能够反哺模型进化,并且在场景中形成数据闭环和数据飞轮,它的意义才真正体现。

光轮智能是独立具身智能数据领域的头部公司之一,围绕人类第一视角数据、物理仿真、规模化评测和真机反馈,构建 Real2Sim2Real 数据闭环。

图片

此次 WRC,光轮智能重点展示了 SimFoundry 仿真和 RoboFinals 评测体系。SimFoundry 通过真实物体参数测量和自研物理求解器,提高衣物、线缆等柔性物体的仿真精度;RoboFinals 则用于机器人模型的大规模测试和评估,让模型在进入真实场景前先经过系统验证。

遥操、UMI、动捕,是以人为中心的高质量数据获取方式,但它们的成本还是太高,较难满足模型对数据量的需求。

具身数据的获取方式还有很多,比如靠视频数据,靠游戏数据,以及最近 1-2 年兴起的世界模型。

极佳视界走的是世界模型路线,将世界模型作为「数据放大器」。GigaWorld 根据机器人动作推演环境变化,批量生成训练和测试所需的交互数据;GigaWorld-1 进一步加入动作建模和物理参数估计,提高抓取、碰撞等操作模拟的可信度。

所以数据并不是一门单纯的硬件生意,而是有多种类型,多种形式的。并且,相比单纯数据采集,为模型提供数据,对于具身智能模型提升更大的,可能是形成数据飞轮,而这是专注在具身数据采集的单个企业很难完成。

要形成数据闭环和数据飞轮,必须进入具体场景,和机器人一起协作,用真实产生的数据去迭代和优化模型。

例如,银河通用构建了「银河星数(AstraData)」数据基座,将互联网数据、人类行为数据、仿真合成数据、真机遥操和真实场景回流数据统一用于模型训练,并接入场景验证和回流优化的闭环。其通用小脑模型 AstraBrain-WBC 0.5 使用约 2 万小时、20 亿帧人类动作数据训练,工程优化后推理延迟低于 1.5 毫秒,整条动捕链路延迟小于 20 毫秒。

智元机器人的数采 2.0 体系,基于 430 余个真实场景搭建真机、无本体和多源数据金字塔,并把模型评测、场景落地、实景适配测试和运行数据回流放在同一体系中。

更进一步,还有海外创业公司在工厂环境中让现场工人现场纠正机器人,然后把新的行为继续接入流程,并且收集数据对具身模型进行 Post-Training。

银河通用、智平方、智元机器人等中国公司也已经在往这个方向进步,未来具身数据的共同趋势可能是:数据采集将从「集中式数采工厂」走向「机器人部署现场」。

04、关键部件往前走了几步?

灵巧手、触觉感知、视觉感知、电机、关节,关键零部件的进步,往往更能展示行业真正往前走了几步。而具身智能关键零部件领域,最重要的精细操作和感知,感知里最重要的又是触觉感知、视觉感知。

灵巧手是机器人执行精细操作的关键。以灵心巧手为例,它展示了「灵巧手组装灵巧手」的案例:机器人通过视觉识别、双手协同和精准力控,在狭小空间内完成零部件抓取和装配,把灵巧手从抓取进一步推进到精细工业操作。

同时,灵心巧手也在持续提升模型能力。它告诉我们,目前在商超、工厂和物流等相对明确的场景内,已经可以对多种工具和工序实现一定程度的泛化,但跨到完全不同的场景仍需要继续学习。

灵心巧手也涉足了具身数据,Open TeleDex 系统可以同步采集视觉、触觉和本体感知数据,用于训练灵巧操作模型。它把理想的灵巧手概括为「既要有人的手,也要有人的小脑」:最终不仅要能抓不同物体,还要能够理解并使用不同工具。

帕西尼感知的核心能力是触觉。它采用自研的 6D 触觉感知芯片,这次帕西尼还展示了足底多维触觉传感器 PX-FOOTRIX,以及基于 GEN4 FUSE 芯片的第四代多维触觉产品,覆盖夹爪、全身电子皮肤等形态,进一步把感知扩展到全身。

这背后是帕西尼在结构设计、硬件系统和算法模型上的全栈自研。在这个基础上,帕西尼打通了从触觉感知信号采集,到三维力、六维力输出的完整链路,使机器人能够获得更稳定、可重复、可量化的力触觉信息。

触觉的应用还是要回到操作,帕西尼现场展示了人形机器人在视觉和触觉共同参与下自主拼装小马:先识别不同形状的零件,再根据接触状态判断抓取是否稳定、插装是否到位,并动态调整力度。

帕西尼也把触觉延伸到了数据采集,PXCap Pro 五指数采手套可以同步采集视觉、触觉和手部姿态,并将同一套人类示范重映射到不同灵巧手,实现「一次采集、多机复用」。

帕西尼还把触觉数据纳入 OmniSharing DB 百亿级全模态数据集,与视觉、轨迹、姿态、语音和文本等数据一起用于具身模型训练。其中比较特别的是多维触觉数据,它能记录人与物体接触时的受力和状态变化。

在视觉感知方面,奥比中光展示了面向具身智能的 Gemini 330 系列双目 3D 相机,搭载自研 MX6800 深度引擎芯片;最新的机器人视觉新品 Physis,专为人形机器人、协作机械臂等需要长时运行的具身智能应用设计,提供贴近人类的视觉感知能力,在大视野、高质量成像、真实空间感知与高可靠性之间实现极致平衡。

图片

同时,奥比中光也把视觉能力延伸到具身数据采集,推出无本体数据采集平台,将 EGO、UMi、Wrsicam、Hub 等四种形态纳入同一体系:EGO 记录第一视角,WristCam 采集腕部近场视角,UMI 补充手与物体的交互动作,形成多视角数据链路,用于模仿学习和世界模型训练。

灵巧手、视觉感知以及其他感知能力,其重要性在于它们是具身智能真正落地的最后一厘米。哪怕模型再聪明,没有好的灵巧手,机器人也无法像人一样完成精细操作,没有感知,机器人就变成瞎子,根本不知道该怎么干。

我们同时观察到,灵巧手和感知领域的公司,都在跨界搞具身智能数据,可见具身智能整个行业,对于数据的饥渴程度。

05、行业整体发展到什么阶段?

具身智能的热潮让人想到十年前的计算机视觉和自动驾驶。当时市场同样相信技术会在几年内迅速普及,但实验室能力与稳定、低成本、可规模部署的产品之间,存在很长的距离。

自动驾驶用了十多年,才开始在少数城市和区域进入 Robotaxi 商业运营。这虽然不能证明具身智能会重复相同过程,但说明了一种规律:

技术热潮往往会让人们高估近期落地速度,却可能低估长期产业影响。

具身智能目前仍处于从原型验证走向产品验证的早期阶段。未来几年可能先在工厂、物流、巡检和商业服务等结构化场景中落地,真正进入家庭和日常生活还需要更长时间。因为具身智能是软硬件结合的,而且是长产业链的系统工程,单个领域的突破,很难让行业整体快速向前。

但另一方面,中国拥有较完整的机器人供应链、制造能力、工程人才和大量真实场景,能够缩短整机试制、成本下降、场景部署、数据获取和产品迭代的周期。

这些条件不能保证某家公司或者某条路线一定成功,但能让中国持续把机器人推入真实场景,完成技术、工程和商业验证。

热潮终会退去,具身智能进入普通人的生活,可能比市场期待的更久,但当机器人真正开始在工厂、仓库和家庭里工作,具身智能的故事才刚刚开始。

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup