8.86秒!机器人百米跑再破纪录,却端不好一杯水?
2026-08-25 23:49:00  搜狐网   [查看原文]

来源:21世纪经济报道来源:中国新闻周刊近日,在北京举行的第二届世界人形机器人运动会上,机器人400米赛跑成绩已提升至38.15秒,比人类男子400米世界纪录快了近5秒;跳高纪录更是达到2.88米,把人类保持的2.45米世界纪录远远甩在身后。8月25日,继开幕式上跑出的9.39秒,来自北京人形机器人创新中心的天工机器人,跑出了8.86秒的最好成绩,再次刷新纪录。比“飞人”博尔特保持的人类男子百米世界纪录9.58秒快0.72秒。场馆里的欢呼声还没落下,隔壁的灵巧手专项赛现场却透着肉眼可见的吃力:参赛机器人要在5分钟限时内完成积木搭建、镊子夹豆、粉末称量等“指尖微操”,可组委会委员巩潇坦言,预赛中不少机器人一旦遇到物体材质、软硬度或摆放角度的细微变化,自主决策仍然可能出现偏差,这种面对真实物理世界的不确定性,恰是目前技术攻关的核心难点。能破人类纪录的“钢铁飞人”,到了指尖却未必稳得过学龄前儿童。这种“体格”与“大脑”的严重错位,正是当下人形机器人行业最尴尬的缩影。8月20日,宇树科技创始人王兴兴给出了行业公认的临界点:当人形机器人在80%陌生场景中能通过语音指令自主完成80%的日常任务,才算迎来属于这个赛道的“ChatGPT时刻”。话音刚落,宇树科技作为人形机器人第一股上市次日收跌18.70%,单日市值蒸发超600亿元——资本市场用脚投票的冷峻,与产业界对下一个十年的乐观,在同一天形成了微妙对峙。此刻,卡住所有玩家的,恰恰是最核心的“大脑”之困。打开APP,查看更多精彩图片8月23日,第二届世界人形机器人运动会的400米预赛现场。图/IC今年5月,美国机器人公司Figure曾经连续直播19个小时以上,机器人在流水线上分拣超过23.8万件包裹。不过直播过程也出现不少意外情况,比如机器人不能捡起意外滚落的包裹;再比如机器人突然停止工作,连续十多秒双手抬起做骑车状。有人甚至质疑,机器人仍由人操作,人换班时机器人就会“罢工”。国内亦有人形机器人做类似的“干活Demo(展示)”。6月底,智元机器人在龙旗科技的平板质检流水线上进行6天直播作业。近期的世界机器人大会(WRC)现场,能看到各类Demo,从分拣到理货,不一而足。一位负责人形机器人后训练的工程师告诉《中国新闻周刊》,一些人形机器人“干活”的Demo,往往只是在特定场景执行单一任务,一般只需要几百条数据微调。“比如机器人在WRC现场所做的展示,一般需要工作人员提前一两天到场,现场采集几百条真机数据,再微调一下既有模型即可。因为这种展示可能对成功率要求并不严苛,七八成成功率即可,训练模型完成这种展示并不困难。”但是从Demo到真实场景应用,还存在巨大的鸿沟。鸿沟之所以存在,就是因为具身模型的泛化能力不足。“泛化能力就是机器人今天只学习抓起苹果,明天就能抓起梨,而不是只有学过才会做。”北京人形机器人创新中心(下称“北京人形”)具身智能部负责人鞠笑竹告诉记者。昆仑行机器人联合创始人兼CTO郎咸朋喜欢以机器人拿起杯子为例,训练时机器人只见过空杯子,那么它是否能成功拿起装满水的杯子,这就是对泛化能力非常直观的一个检验。具身模型泛化能力的不足,不仅体现在无法识别出没有见过的对象上,还体现在对于不同环境的适应上。前述工程师表示,展示Demo时能更好控制各种环境变量,但是在现实环境中,同一台机器人不同时段的表现都可能完全不同,比如光照发生变化,机器人表现也会变化,因为它们对于光照变化很敏感,其直接影响视觉信息的像素。“目前的现实情况是,人形机器人在特定场景面对特定任务可能达到很高的成功率,但是一旦面对新场景、新任务时往往表现很差,成功率趋近于零。”人形机器人每次面对新的任务、场景都需要重新学习,这在很大程度上被认为受困于具身模型当前的技术路线。在具身智能领域,VLA模型(视觉—语言—动作模型)2023年兴起,此后便有大量基于VLA模型的具身模型推出。2025年,国内的银河通用、智平方、自变量等企业均对外发布VLA模型。人们希望利用VLA模型处理视觉、语言信息的能力,利用机器人传感器获取的数据进行训练,最终实现执行任意任务的能力。“2025年初,大家发现VLA模型泛化能力并没有那么好。”鞠笑竹认为,限制VLA模型泛化能力的一个关键因素在于数据。“VLA模型无法使用大量视频数据训练,更多依赖真机采集数据,很难上量。”前述工程师告诉记者,他正在尝试用仿真数据替代真机数据,因为前者可以无限生成,更容易上量,但是数据质量对训练结果的影响很大。对于VLA模型而言,使用真机输出的动作信息进行训练才能保证误差最小,从而达到最好的训练效果。国内企业对于具身模型的真正投入都比较有限。“多数具身模型其实就是两类来源,要么是很小的数据量套用开源框架简单训练而来,要么就是直接微调开源模型而来。”自变量CEO王潜表示。“王潜所说的情况并不鲜见,国内真正做具身智能模型预训练的公司比较有限,更多是基于美国公司的开源具身模型,如PI的π0.5、英伟达的GR00T等VLA模型进行后训练,也就是针对具体任务、场景进行后训练。”前述工程师坦言。根据他的观察,今年情况开始改变,更多公司今年也开始进行一些基础模型预训练。不过各家公司对于基础模型的投入差异比较大。“比如像自变量模型团队的人数就比较多,而且内部部门划分很细致,负责基础模型、数据等环节的部门,之前他们也推出了开源具身模型。”“即使进行具身模型预训练,多数公司还是会使用一些开源模型的权重。”他认为,中美公司在基础模型上仍有一定差距,比如国内对标比较多的π0.5其实是PI去年开源的一款基础模型,两边应该有数月到一年的差距。4月7日,在广州海珠区的广东省具身智能训练场,工作人员在模拟环境下训练机器人进行电力设备巡检与维护。图/新华当前具身模型在部署到具体场景时都需要后训练,这也是国内人形机器人企业在跳过模型预训练,更多“卷”后训练的原因。既然模型能力有限,不如面对具体场景和任务更多收集数据,提升表现。鞠笑竹认为,针对具体场景和任务,基于VLA进行后训练,对于基础模型能力的提升意义有限,更多只是在拼落地能力与交付。“一旦某个场景被开发出来,大家就会蜂拥而至。后训练就是用大量真机数据训练VLA模型,就跟训练智驾模型的方式一样,不断发现corner case(边缘场景),从而提升人形机器人表现,这种能力可能难以迁移到新的场景和任务。”这种后训练的成本并不低。就在8月中旬,自变量也效仿Figure进行人形机器人物流分拣直播,分拣效率达到1816件/小时,超过此前Figure 1248件/小时的纪录,效率提升了45%,而且直播时的成功率达到98%以上。有接近自变量的人士向记者透露,为准备这场直播,自变量累积了大量数据进行训练,数采员数量超过百人,早晚两班倒,底薪6000元,还有绩效奖励。一则招聘广告展示了数采员的工作状态,纯夜班岗的工作时间是晚10:00到早7:00,中间休息一个小时,每晚有50元夜班补助。“24小时,早晚两班倒,这种数采方式堪称‘变态’。”上述人士告诉记者,为了完成这次直播,自变量使用了10万小时真机数据进行后训练。8月17日,在北京市海淀区AI原点社区内的一处真实场景试验室,一款搭载具身大模型的机器人进行播放唱片训练(上图)和整理家务训练(下图)。图/新华“目前来看,机器人面对具体场景和任务的表现,在数据上的差异相比模型上的差异能产生更大影响,特别是真机数据,使用1万小时的真机数据训练出的模型,可能比用10万小时模拟数据训练出的效果更好。”优必选副总裁、具身智能与人形机器人研究院院长焦继超告诉记者。但是采集真机数据的成本,目前比较高。优必选目前每天的真机数据采集量约在8000小时,经过清洗等处理后留下的有效数据占比约为25%。不过焦继超表示,VLA模型的部署成本可能并非大家想象的那么高,同样是物流行业的分包工作,从A公司迁移到B公司的成本相对可控,因为面对的包裹相差不多,环境可能稍有差异,比如工作台不同,迁移时可能只需要再采集几千条数据,用一两个月时间就能完成。“随着数据积累,一旦突破某个点之后人形机器人能力的提升就会变得非常快。”焦继超坦言,如果人形机器人面对从未见过的快件,可能很难完成分拣,但是如果只是快件尺寸、颜色发生变化,人形机器人能展现出一定的泛化能力,并非一定需要“见过”。“像搬运这样的场景会在今年或明年实现真正规模化落地,下一步会转向一些轻便灵巧类的任务,比如拧螺丝,以及一些长程任务。其实客户并不关心人形机器人究竟在使用什么基础模型,他们更关注其在工作场景中的表现,对成功率的关注高于效率。”焦继超告诉记者,早期一些客户的容忍度比较高,但是真正在场景规模化落地的成功率至少要达到99%以上。“基于VLA模型进行后训练,依然可以在一些比较标准的场景中短期落地,但是从未来人形机器人的终极目标来看,无论进厂还是进家可能面对无穷无尽的场景组合,只有人形机器人的泛化能力足够强才能应对。”鞠笑竹说。在具身模型能力有限的情况下,通过“卷”后训练落地具体场景,更多是商业化的权宜之计。8月21日,2026世界机器人大会期间,多台工业机械臂与人形机器人模拟汽车车身产线协同作业,展示工业机器人、人形机器人在汽车制造领域的柔性生产应用方案。图/视觉中国从去年开始,业界与学界都开始将实现通用人形机器人的希望聚焦到世界模型。力挺世界模型的美国学者杨立昆、李飞飞成立的公司都在短期内获得10亿美元规模的融资。国内业界亦快速跟进世界模型,今年以来,自变量、智元等公司相继发布世界模型。2025年底,朗咸朋还是理想智驾团队负责人,他是智驾领域VLA路线的拥护者,也了解VLA的上限。他坦言,具身智能需要“新故事”,主题就是世界模型。他今年参与创立的昆仑行机器人,在3个月内就获得了10亿元融资。世界模型之所以让人兴奋,便在于其展现的泛化能力。英伟达介绍,世界模型更具泛化性,能让机器人完成没有见过的任务。“当前针对单一场景任务,基于VLA模型再进行后训练,确实能获得更好效果,世界模型生成的动作在精度上还没有达到VLA模型的水平。”郎咸朋做出这样的类比,世界模型与VLA模型的差距有一些像智能驾驶是否依赖高精度地图的区别,如果依赖高精度地图,每到一座新的城市,就需要从采集数据做起。星源智创始人刘东告诉记者,从星源智推出的世界模型来看,所需的真机数据大概只占全部数据需求的10%。2025年初“北京人形”内部开始讨论世界模型,4月开始做,11月就推出一版开源模型。今年8月,“北京人形”发布了大一统模型 Pelican Unify。鞠笑竹表示,在这个过程中一直在思考世界模型究竟能给具身智能带来什么。“其实世界模型也分为不同的路线,比如国内比较火热的路线是基于现有视频生成模型的世界模型。”尽管鞠笑竹认为,它可能并非未来具身模型的终极答案,但是仍对其在泛化性上的表现感到兴奋。“比如在训练视频生成模型时,不可能有小猫、小狗说话、跳舞的视频,但是我们能生成这样的视频,这说明它能把人类的动作映射到小猫、小狗上,那么小猫、小狗是不是可以变成一台人形机器人?这样就能生成大量人形机器人模仿人类操作的视频,这首先意味着未来可以使用海量人类在不同场景下工作的视频,进行大规模训练,而非像VLA模型那样只能依赖真机数据,难以上量。”3月11日,江苏无锡市,优必选子公司优启的人形机器人实验室。图/视觉中国鞠笑竹介绍:“真机数据依然需要,但是相比过去那种重复某一运动轨迹几百上千次的数据,更需要多样的数据,这样才能避免未来训练出的模型陷入局部最优的陷阱。”“在训练世界模型时,需要在训练数据中加入原始动作数据中蕴含的物理量和物理关系,这样模型才有可能理解物理世界。模型训练中有句话‘garbage in,garbage out’(你喂给它垃圾,也会产出垃圾)。如果训练使用的数据只是一些运动轨迹信息,那模型学习时也只会模仿这些运动轨迹,而非理解其背后的物理因果关系。”郎咸朋说。不过,一旦涉及基础模型,特别是世界模型预训练,对机器人企业算力、数据、人才和资金等资源方面的压力都比较大。“北京人形”在算力上还算充足,但是对于世界模型预训练而言仍然捉襟见肘。“像英伟达训练cosmos模型依托于8000块B300的算力资源,未来可能需要国内进一步统筹资源。”鞠笑竹说,“大家也有疑问,大语言模型参数规模已经高达千亿、万亿级别,一个几十亿参数规模的世界模型谈何理解物理规律?”鞠笑竹认为:“留给具身智能企业的选择已经不多,要不开始做自己的基础模型,要不就不要做了。”宇树科技上市后,模型研发成为最大的单一募投方向:42.02亿元募集资金中,20.22亿元投向模型研发项目。不过由于技术尚未收敛,没人敢押注特定模型路线。“从具身模型的发展来看,并非阶梯式上升,而是螺旋式上升。比如很早的时候,有人希望大模型自己编程,编辑一些模块化技能,再交给机器人操作,李飞飞探索过这条技术路线,当时成功率很低,不被认可。但是随着大模型编程能力提升,很多人又开始重新审视这条技术路线。”鞠笑竹认为。郎咸朋将当前具身智能所处的阶段类比于10年前的智能驾驶,当时智驾领域也是Demo很多,但是技术并未收敛。“未来具身模型的范式可能还会经历迭代,迭代可能导致之前的努力白费,但让机器人理解物理规律一定是方向。”

OCR:IMG:D0O 1000 UOOD 1000 宣意茶

OCR:IMG:WELCOME

OCR:IMG:ASUN新松 SIASUN新

本栏目中的所有页面均系自动生成,自动分类排列,采用联索网络信息采集、网页信息提取、语义计算等智能搜索技术。内容源于公开的媒体报道,包括但不限于新闻网站、电子报刊、行业门户、客户网站等。使用本栏目前必读