mt logoMyToken
ETH Gas
日本語

2026世界机器人大会王兴兴全文演讲:具身智能的ChatGPT时刻最快两三年就会到来

収集collect
シェアshare

宇树科技上市后第二天,其创始人王兴兴在2026世界机器人大会发表题为《从展品到产品:人形机器人产业的下一个十年》主题演讲。他认为,当前机器人产业正站在人工智能加速发展的新起点,而现阶段该领域最大的发展瓶颈仍然是具身智能的泛化能力不足。

“从发展周期来看,快则两到三年,慢则五到十年,行业有望迎来关键突破。”关于具身智能迎来类似ChatGPT的产业临界点的时间,王兴兴给出了相对乐观的判断。

而谈及通用机器人何时真正走进家庭,王兴兴认为,全世界目前最大瓶颈还是泛化能力不够。“如果哪一天大家能看到把一台机器人带到一个任意的陌生环境,它基本可以实现80%左右的任务,我觉得就差不多已经实现了具身智能的ChatGPT时刻”。

以下为演讲内容为PANews整理:

回顾宇树十年:从四足机器人到人形机器人

尊敬的各位领导、各位嘉宾,大家好。非常荣幸在这里做分享。首先简单回顾一下公司的情况。宇树科技成立于2016年8月,到今年8月差不多整整10年。我们最早做的是四足机器人,最近几年开始做人形机器人。

近几年比较成功的一款产品,是我们2024年推出的G1。G1推出以后,基本成为了全球人形机器人领域比较有代表性的产品。现在大家看到的很多人形机器人产品,无论是整体形态还是设计思路,都和G1有一些相似之处。

今年年初比较有代表性的一个项目,是我们在春晚上表演的《武BOT》。这个节目融合了中国非常经典的传统功夫和武术文化。我们提前采集了几十个有代表性的中国功夫动作,再进行AI训练,最后把比较精彩的动作放到整个舞台上。这个节目最大的亮点,是把当前比较前沿的人形机器人技术与中国传统功夫、武术文化结合在一起。这个视频在海外的传播也非常好,可能有数百亿次播放。我觉得这是一个科技和文化融合得比较好的例子。

2月份,我们还在天坛做了一次演示。当时现场大概有49台机器人进行全自动表演。天坛本身有几百年的文化和历史,机器人在这样的场景里表演,会形成一种非常强烈的穿越时空感——把中国过去几百年的文化和当前最新的技术交融在一起,视觉和感受上都非常震撼。

过去几年,我们也一直在推动机器人真正走进生活、走进工厂。2024年,我们就开始和汽车工厂合作做一些落地应用,也在自己的工厂里部署机器人,做一些简单的测试和应用。现在公司绝大部分AI团队,都在围绕机器人如何真正进入家庭或者工厂干活做研发。

为什么目前还没有大规模推广?最主要的原因,是机器人的效率和泛化能力还不够。现在机器人已经能够做一些简单装配,但效率和人相比仍然偏低;另外,每次遇到一个新的任务,往往还需要重新训练,这会进一步降低整体效率。所以我们还是希望先把技术的泛化能力做得更好,再进行大规模推广。这也是目前全球机器人行业共同面对的一个核心瓶颈。

今年4月份,我们还刷新了人形机器人奔跑速度纪录。这款机器人是在我们2023年第一代人形机器人H1的基础上改制的。H1是宇树第一款人形机器人,也是比较经典的一款产品。后续我们也在它的基础上尝试不同形态,比如增加轮式结构,让机器人在一些场景下能够更加灵活。

驱动机器人:AI、数据与真实场景

大家也知道,现在的机器人基本都是AI驱动,而AI本质上又是数据驱动。数据有多少,尤其是高质量数据有多少,很大程度上就决定了AI能力能做到什么程度。所以我们一方面自己采集数据,另一方面也和第三方公司合作,希望获得更多数据,既给行业使用,也给我们自己使用。

我个人认为,真正用于AI机器人训练的数据,应该以大量真人数据或者互联网数据作为主要的预训练数据,再叠加一部分真机数据。这两部分数据都是刚需。从数据规模上看,真人数据会更多,也更加重要;但真机数据同样不可缺少,因为最终还是需要把机器人和真实物理世界匹配起来。

今年5月份,我们发布了全球首款量产级载人变形机甲GD01。这款机器人身高3米多,载人以后重量大概500公斤。大家可能会好奇这类机器有什么应用。简单做一个比喻,它有点像一辆“越野车”,并不是主要面向家庭或者城市里的日常使用,而更适合户外、复杂环境以及一些运输场景。比如出去户外徒步,或者在地形比较复杂的地方运输物资,都可以考虑使用它。

GD01还有一个比较有意思的特点,就是可以变形成四足模式。切换到四足模式以后,稳定性会更好,越障能力也比较强。这也是我们为什么愿意把它真正拿出来预售的一个原因:在四足模式下,它已经具备相对比较好的稳定性和复杂地形通过能力。简单来说,可以把它理解成机器人形态的“越野车”。

前几个月,我们还演示过一个基于多模态模型的端到端AI动作生成系统。过去很多机器人动作演示,都是提前采集、提前训练好的;而这套系统的动作可以根据实时语音指令生成。语音首先需要被识别,再上传到云端做AI动作生成,之后还要对动作进行验证,确认没有问题再下发给机器人,所以整个过程目前还会有几秒钟延迟。

我们希望未来机器人真正落地应用的时候,动作能够完全实时生成,而不是依赖提前编程。现在这种自动生成方式还有一个特点:即使输入完全相同的指令,每一次生成的动作也可能略有差异。也就是说,你今天和明天对机器人说同一句话,它做出来的动作可能不会完全一样。

我们也在推动机器人真正进入会议室等日常场景干活。比如公司里的会议室有时候会比较乱,那么会议室整理就是一个比较明确、也有实用价值的任务。我们的训练目标是:把一个会议室任意打乱以后,机器人都能够把它恢复到干净整洁的状态。

这个任务目前是完全端到端实现的,所以机器人的运动效率还比较慢。但它不是单任务系统。在这个场景里,我们大概设置了7到8个不同任务,用一个模型让机器人在不同任务之间自动切换并直接执行,同时具备一定的抗干扰能力。因为AI需要实时识别、实时生成和持续推理,所以动作暂时还没有那么流畅,每走一步、每做一个动作都需要推理,这会影响整体“丝滑度”。不过演示视频本身是一镜到底,没有做剪辑,也加入了环境干扰。

在此基础上,我们又把语音驱动和多模态模型结合起来,让机器人不仅能根据语音生成动作,还能够真正完成交互和操作任务。现场演示中,机器人可以识别眼前物体的颜色、判断不同药盒的位置,再根据语言指令把指定物体拿出来。这种情况下,机器人执行的就不是一个预先设定好的固定动作,而是需要理解语言、识别环境,再完成操作。

前段时间,我们还发布了最新一代轮足四足机器人As2-W。这款机器人比较轻量化,带电池重量大约25公斤,负载能力和续航能力都比较强,同时具备IP54防尘防水能力,可以覆盖室内和室外场景。

我们把一些在人形机器人上积累的技术重新应用到了四足机器人上,希望进一步提升四足机器人的灵活性,同时把负载、续航和复杂环境适应能力做得更好。我们也希望这款机器人未来能够真正用于户外徒步、运输以及一些工业场景。

与此同时,我们也持续升级R1这类轻量化人形机器人,让它的运动和灵活性进一步提高。R1本身的性价比比较高,也已经可以通过京东、淘宝等渠道购买。

前段时间,我们还展示了一款新的机器人。这款机器人开发时间很短,到现在大约只用了三个多月,还不是正式发布版本。它的最高速度已经达到12.65米/秒,超过了人类历史上最快运动员的峰值奔跑速度;按照目前的测试结果,它的跳跃高度也已经超过了人类历史上的最高跳跃水平。2025年,我本人、公司的产品以及宇树科技也都曾登上《时代》杂志相关榜单。

具身智能的核心瓶颈:泛化能力与真实世界对齐

再回顾一下最近几年具身智能AI模型的发展。目前比较主要的技术路线包括VLA模型和世界模型。今年大家听到最多的,可能就是世界模型这个方向。

我们公司对AI模型一直投入很大,这也是目前资金和人力投入最大的方向之一。2020年初,我们就开始探索基于视频生成的世界模型。当时到2020年底,效果还不是特别理想,所以中间搁置过一段时间;但是从去年开始,我们又重新加大了对视频生成世界模型方向的投入。

很多人都会问:真正通用的机器人,无论是人形机器人还是半人形机器人,什么时候才能真正走进生活、走进家庭?

我认为当前最大的瓶颈,仍然是具身智能的泛化能力不够。现在很多AI模型在固定场景里,只要做足够的数据采集和训练,成功率基本可以做到接近100%。但只要操作的物品稍微变化,或者环境发生一点变化,成功率就会明显下降。

我希望未来快的话可能两三年,慢的话五年甚至更长时间。如果有一天,把一台机器人带到一个它完全陌生的环境,比如一个它从来没有见过的家庭,它仅仅通过语音或者语言指令,就能够完成80%左右的任务,那么我觉得就差不多到达了具身智能的“ChatGPT时刻”。这也会成为未来产业真正爆发的一个关键临界点。

这个评价指标其实很简单:机器人在大约80%的陌生场景里,仅通过语音或语言指令,就能够完成大约80%的任务。我觉得这是一个非常重要的临界点。

为什么现在还达不到这个水平?最大的瓶颈之一,是AI模型的输入输出和真实机器人、真实物理世界之间的对齐程度还不够。

比如你让机器人移动,或者让它把两个东西装配在一起,或者把一个物体从一个地方搬到另一个地方,它的大方向往往没有问题,基本能够理解你的任务,也大体知道应该怎么执行。但真正影响最终成功率的,往往是最后几厘米甚至最后几毫米。

机器人去抓一个东西的时候,看起来手已经快要拿住了,但最后一点触觉反馈、最后一点位置误差,它没有办法很好地修正。这个误差如果没有修正好,最终就可能导致整个任务失败,成功率会出现非常明显的下降。

这是目前全世界具身智能面临的一个非常核心的问题:AI模型的输入输出和真实世界之间存在偏差。

为什么机器人上会有这个问题,而一般的语言模型或者多模态模型没有这么明显?语言模型处理的内容,本质上都是数字编码。输入是什么、输出什么,都被严格限制在一个数字空间或者向量空间里,因此误差不会以同样的方式不断累积。

但机器人不同。机器人的每一次输入和输出都要进入真实物理世界,每执行一次动作,都会产生一定的偏差和损失。这些偏差会影响下一次感知和下一次动作,最终造成误差累积。也正因为如此,目前机器人模型的泛化能力和实际任务成功率还没有达到足够高的水平。

我觉得这个问题在未来几年一定能够解决,但它确实还需要一些时间。

让机器人自进化:用AI重构机器人研发流程

这里我再介绍一下我们最近正在推动的一件事情:直接让物理AI机器人模型实现自进化。

过去几年,大家已经大量使用AI做编程和各种AI开发,但是对于AI本身在机器人研发流程中的使用,我觉得目前还相对欠缺。我们最近在推动的,就是尝试用当前最前沿、最顶尖的大模型来驱动机器人研发。

具体来说,我们可以先给AI设定一些规则、经验、约束和工具,让它自己去网上搜索最新论文、最好的研究成果以及各种开源方案。之后让它自己编程,生成机器人的控制代码。

控制代码生成以后,可以先放到仿真环境里运行和训练,也可以进一步调用模型和控制系统,去驱动真实的实物机器人。

如果部署到实物机器人上,我们就可以做真实测试,然后对结果进行评价和打分。评价的一部分可以由机器人AI模型自己完成,另一部分也可以由人来参与。人的经验仍然非常重要,因为很多时候,人能够很容易判断一个动作做得好还是不好。

如果这套逻辑真正形成体系并运行起来,整个机器人的开发效率会提高很多,迭代速度也会非常快。这个流程持续运行一段时间以后,就有机会真正形成机器人自我进化能力的提升。

这里可以举一个最简单的例子。我们可以使用一个Coding智能体,让它自己编写机器人的控制代码。现在很多比较简单的深度强化学习算法,用Coding智能体自动编程,效果其实已经不错。

代码生成以后,我们把它放到仿真环境里面去做验证和训练;效果达到一定程度以后,再把它部署到实物机器人上做测试。测试之后,一方面由AI模型进行评价,另一方面也可以加入人工打分,判断效果怎么样。再把这些结果反馈给编程智能体,进入下一轮代码生成和优化,最终形成一个持续迭代的正向循环。

刚才说的只是一个最简单的示例,真正使用的时候会复杂得多。但我觉得这是当下以及未来几年全球机器人行业非常值得做的一件事情。

为什么要这么做?有几个比较直接的原因。

第一,基础模型的能力每个月、每年都在提升,那么自进化循环本身的能力也会随之提升。也就是说,这套系统天然能够跟随全球AI基础能力的进步而不断变强。

第二,它能够更加充分地利用多元数据。过去依靠人工去处理和使用数据,整体效率比较低。如果形成自循环,我们就可以把各种训练数据、真实世界数据以及人的数据都利用起来,而且数据利用效率会更高。

第三,它可以和更多真机部署形成闭环。随着真实机器人部署越来越多,我们会不断得到新的测试数据,也会获得越来越多的评价指标。这样一来,整个系统的数据利用率和数据增长速度都会得到保证。

第四,它能够持续积累机器人的技能。我们可以每天、每个月不断增加一些新的技能,而不是今天开发了一个技能,明天又把这个技能浪费掉,或者重新从头做一遍。技能、数据、控制策略和评价结果都可以在这个系统中持续积累。

所以我觉得这是一件非常重要的事情:真正使用AI去大幅提升机器人的开发效率和进化效率。未来,这种方式很可能会成为物理AI机器人持续进化的一条重要路径,也可能开启一个新的阶段。

我觉得未来这个方向会有越来越多人推动。

回过头看,宇树已经走过差不多10年。我们大概在2017、2018年就第一次参加世界机器人大会,这些年一路走下来,感受非常深。

站在今天这个新的阶段,尤其是在AI快速发展、全球对机器人关注度非常高的背景下,整个机器人的进化速度已经明显加快。未来机器人的发展速度,可能还会比我现在预估的更快。

我觉得,这是一个全新的起点,也是一个全新的开始。

由于时间关系,今天汇报得比较简单。谢谢大家,也请大家多多包涵。

免責事項:この記事の著作権は元の作者に帰属し、MyTokenを表すものではありません(www.mytokencap.com)ご意見・ご感想・内容、著作権等ご不明な点がございましたらお問い合わせください。
MyTokenについて:https://www.mytokencap.com/aboutusこの記事へのリンク:https://www.mytokencap.com/news/593611.html
community_x_prefix
X(https://x.com/MyTokencap)
community_tg_prefixcommunity_tg_name
https://t.me/mytokenGroup
関連読書