大晓机器人WRC首秀:押注“具身大脑”,离ChatGPT时刻还有多远?

大晓机器人WRC首秀:押注“具身大脑”,离ChatGPT时刻还有多远?

具身智能爆火的当下,通往“ChatGPT时刻的赛程,正从实验室里的算法造神,转向真实商业场景里的拉力赛。

2026年8月19日至23日,WRC 2026世界机器人大会在京开幕,5万平方米、四大展馆、300余家企业同台竞技。当硬件本体的差距逐渐缩小、电机与关节供应链日趋同质化,行业的聚光灯正从“躯壳”向上游的“大脑”转移

与此同时,具身智能的“ChatGPT时刻”被反复提及,却很少有人回答该用什么刻度来衡量。大晓机器人的展台,恰好成为观察这一风向的窗口——它把“具身大脑”拆解成一个个可验证的工程问题,再用真实场景去检验。

从“下一词”到“下一秒”,世界模型为何成了必选项

具身智能的竞争,本质是“谁更懂物理规律”的竞争。在实验室里,让机器人听懂“把红色方块放进抽屉”并不难;难的是在光照突变、包装柔软、货架拥挤的真实环境中,依然能稳定完成任务。

在技术路径上,VLA负责执行,世界模型负责推演,二者协同正成为头部玩家的共识。VLA将视觉、语言和动作纳入端到端框架,优势是落地快,已能在工厂完成拧螺丝等结构化任务。但其短板在于缺乏三维空间的因果推理能力。

大晓机器人WRC首秀:押注“具身大脑”,离ChatGPT时刻还有多远?

大晓机器人世界模型负责人王飞在Workshop中指出,世界模型的核心是:给定当前所见与准备执行的动作,推演未来会发生什么。如果说大语言模型预测的是“下一个词”,世界模型预测的就是“下一个世界状态”同一帧画面,下达不同指令,模型会推演出不同的未来。

这意味着机器人第一次拥有了行动前先在脑海里试错的能力在端侧,开悟3.1会为“开冰箱取水”这类任务生成3到5条候选轨迹,以及对应的5到10秒未来视频,再由评估器择优交付真机执行。失败轨迹不会被丢弃,而是作为下一次的输入,让模型知道上一次为何没抓住把手。

算力数据不是堆数量,而是提密度

如果说大语言模型的规模定律靠“更多词”,具身模型的规模定律靠的就是“更密的因果”。这是理解大晓“以人为中心”数据范式的关键。

制约具身智能的从来不是算力,而是高质量物理交互数据的稀缺真机数据贵且慢,互联网视频多却缺少动作与因果信息。Workshop现场被反复追问的Dyna Robotics百万小时第一视角数据,以及头部企业自建的数采工厂,都在指向同一个问题:数据规模究竟该如何定义?

大晓机器人WRC首秀:押注“具身大脑”,离ChatGPT时刻还有多远?

大晓的答案是三层金字塔架构:底层是开放物理世界理解框架,用于学习自然规律;中间层是以人为中心的人类交互数据,用于学习人为何这样与环境交互;顶层是少量真机数据,用于把前两层的认知对齐到具体本体。

这个结构的本质,是用更便宜、更丰富的人类数据,降低对昂贵真机数据的依赖,让规模定律变得可负担

开悟3.1的训练数据中,视频从约100万增至400万,语言Token从约2万亿增至10万亿,场景标签从约1000个增至1万个。但大晓向速途网指出,在这一过程中,相比数量,密度才是更重要的衡量维度

大晓机器人WRC首秀:押注“具身大脑”,离ChatGPT时刻还有多远?

环境式数采2.0围绕“采得全、标得细、用得妙”构建了三件套。ACE Sense Glove凭借0.01N的极高力触觉灵敏度、小于2°的关节角误差,以及被严格控制在1毫秒内的时间同步误差,实现“采得全”;ACE-ViDiHand攻克遮挡与快速移动难题,以0.997的帧级准确率让动作平滑度跃升4.8倍,实现“标得细”;ACE Ego Matrix以统一时空让异构数据“说同一种语言”,实现“用得妙”。模态密度、场景密度、时间密度三重保障,让高密度真实交互数据得以精准录入

但密度提升不等于能力自动涌现。王飞坦言,未来一两年数据范式不会变,变化的是各层比例——中间层占比会快速提高,但信息提取方式同样关键。百万小时视频若只是直接喂给模型,并不能保证它学会隐空间中的物理因果同样时长的数据,能否转化为同一任务下成功率的幂律提升,才是检验“更密因果”的试金石。

交付是检验具身大脑的唯一标准

架构收敛不等于能力收敛。检验具身大脑的唯一标准,是它能否在真实业务中连续稳定运行大晓的“晓满”“晓新”“晓途”三个方案,把世界模型翻译成了业务语言,分别对应零售的“窄与多”、酒店的“长与乱”、开放环境的“变与广”。

最受围观的“晓满”是即时零售一体化履约方案。其核心不是展示抓取能力,而是回答便利店、前置仓、仓店一体等不同业态的共性难题。多SKU的稳定支持,要求算法处理近万种刚性与柔性商品;高密窄仓,要求在75厘米过道中作业;1牛以内的力控,是为了不捏扁包装;而高峰连续作业与天级部署,则是生死线,因为业务系统能否次日上线,决定了机器人是资产还是负担。

目前,该方案已在烧卖购、快客达、中石油便利店推进。银河通用Galbot已在北京实现近十家店“1天部署”、覆盖5000种商品,让零售已成为2026年最可验证的具身智能场景之一

如果说晓满考的是“广”,晓新考的就是“长”。酒店客衣服务是一条包含取衣、洗涤、转运、烘干、折叠、送回的长链,任何一个时序错误都会导致整段失败。更难的是长期无人值守下的容错能力,大晓机器人副总裁刘春晓坦言,单次失败不能让机器人停在原地。晓新依托ACE-BRAIN-0.5做长程拆解与时序规划,再结合世界模型的平行推演与反思——机械臂第一次开门未抓准,失败结果会进入下一次推理并迭代策略。这种“失败自恢复”能力,是服务场景能否走向无人化的前提。

大晓机器人WRC首秀:押注“具身大脑”,离ChatGPT时刻还有多远?

晓途则把考场搬到了开放环境。它是厚度控制在10厘米以内的四足大脑模组,可适配多种本体。其优势有二:一是任务编排灵活,基于Agentic AI,用自然语言即可拆解调用;二是导航鲁棒,采用视觉为主的无图导航,无需预建图即可实现室内外无缝衔接。一人可在云端管理10台,目前已在漕河泾等地落地。

这三条路径共同指向一个判断:2026年的竞争焦点,已从“能不能做”转向“能不能规模化复制并走向盈利”。单店成功只是起点,能否从一家店复制到一百家、从一人管十台扩展到百台,才是区分演示与交付的分水岭。而日均单量、抓取成功率等运营数字,将成为衡量具身智能成败的重要依据。

具身大脑离ChatGPT时刻还有多远

当所有人都在谈论“ChatGPT时刻”,大晓在Workshop中给出了更具体的进程表:今年下半年朝百万级人类数据储备迈进,未来向千万级推进,并希望以此推动能力跃迁。

首先是架构一体化。开悟3.1把理解、生成、预测纳入同一套Transformer联合训练,打通“看懂、想明白、能执行”的全链路

其次是部署实时性。8B模型在NVIDIA Jetson Thor上以BF16实现125毫秒延迟,靠的是KairosRT将计算复杂度从平方级降至线性。此外,Kairos-HomeWorld基于30万套中国住宅平面图、5000个全屋仿真场景、8700个高质量3D资产构建,更贴近本土家庭环境。

中国拥有全球最完整的工业门类与最丰富的服务业场景,这为异构数据的规模化采集提供了硬件成本与场景产能的双重优势。但优势不会自动转化为壁垒。如今,DiT技术底座正在趋同,真正的壁垒已转移到企业对异构数据的清洗能力、迭代速度与资金筹措能力。

在大模型之家看来,2026年无疑是具身大脑的“部署态元年”,但部署并不等于涌现。前者是进入真实付费场景,后者则要求在陌生场景中实现稳定、可解释的泛化。

因此,判断具身大脑是否逼近ChatGPT时刻,不妨换三个更诚实的问题:它能否在陌生门店连续72小时无人工干预完成履约?它的失败自恢复率能否被量化并持续提升?它从一家店到百家店的迁移成本是否可控?

当这三组数字可以被公开、被复现、被比较时,“涌现”才不再是隐喻,而是工程。

WRC首秀虽没有让大晓机器人直接宣告“时刻已至”,但它把衡量时刻的刻度尺摆上了台面。从“下一词”到“下一秒”的范式迁移已收敛,以人为中心的数据密度竞争已开始,从演示到交付的算账逻辑已确立剩下的,就交给真实场景的连续运转来回答——那个被期待已久的跃迁,究竟还有多远。

原创文章,作者:志斌,如若转载,请注明出处:http://www.damoai.com.cn/archives/18224

(0)
上一篇 3小时前
下一篇 2026年4月23日 下午6:37

相关推荐

发表回复

登录后才能评论