编辑|陈陈
世界模型正在成为具身智能最拥挤的技术路口。
有人把它当作机器人数据生成器,通过视频模型批量制造训练素材;有人把它做成高保真仿真环境,用于训练和评估机器人策略;还有一些团队正继续向前,尝试把世界理解、未来预测与动作控制放进同一套模型,让机器人在内部推演之后直接行动。
不同路线在今年 WAIC 迎来一次正面交锋。
7 月 19 日,WAIC 2026 世界模型六小龙巅峰论坛在上海举行。大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人、自变量机器人同台出现,共同探讨「驱动物理 AI 从理解到执行」这一议题:世界模型正驱动物理 AI 实现从理解向执行的跃迁,完成从因果推演到实体控制的闭环,携手共启物理 AI 的开悟时刻。
作为论坛承办方,大晓机器人(ACE ROBOTICS)算得上是六家企业中发展速度较快的一家,被业界称为「卷王」。
公司成立后不久便提出「以人为中心」的 ACE 具身智能研发范式,形成「环境式数据采集 — 开悟世界模型 — 具身交互」的全链路技术体系。
在模型层,开悟世界模型 3.0(Kairos)在四大全球权威具身智能基准上全面登顶,新发布的开悟世界模型 3.1 进一步融合生成智能、物理智能与认知智能,构建起了理解 — 推演 — 执行 — 反思的全链路自进化闭环。
落地上,搭载 A1 模组的机器狗已经进入园区巡检、城市治理等场景;全新履约机器人 W1,可以完成商品拣选、装箱和搬运,已落地 Sense MartGo 烧卖购、快客达等客户场景。
技术和产品推进之外,大晓机器人在资本市场也保持了较快节奏。今年 2 月,公司完成由蚂蚁集团领投的天使轮融资;4 个月后,又完成天使 + 轮融资。至此,大晓机器人在 2026 年上半年累计融资达数亿美元。
WAIC 2026 现场,大晓机器人董事长王晓刚宣布三大核心成果发布:开悟世界模型 3.1(Kairos 3.1)、环境式数据采集方案 2.0,以及覆盖三大垂直场景的成套解决方案。
具身世界模型第一性原理,机器人真正需要理解什么
在数字世界里,模型预测错误,可能只会生成一个不合理的词,但在物理世界中,当具身模型出现理解偏差或预测错误,结果会直接转化为错误行动,带来真实且可能无法逆转的代价。
如何降低这种代价?
基于这一问题,王晓刚首次系统阐释了大晓对具身世界模型第一性原理的理解。
世界模型需要从冗余的多模态输入中,提取与任务和控制最相关的高密度信息,建立能够支持机器人行动的控制充分状态,并在充满不确定性的环境中,尽可能降低智能体的行动代价。
所谓控制充分状态,指的是机器人完成当前任务所必需的关键环境信息。机器人掌握的关键信息越充分,对控制状态的理解越准确,执行过程中犯错的概率就越低,相应的行动代价也会下降。
这一判断,也构成了大晓世界模型技术路线的理论起点。
当前,全球具身世界模型大致沿着几类路线发展。
表征式世界模型擅长从视觉和传感器输入中提取抽象特征,帮助机器人识别物体、场景与空间关系;生成式世界模型更关注未来画面和环境状态的生成,可以模拟动作发生后,世界可能呈现出的变化;交互式世界模型则强调智能体与三维环境之间的持续反馈,使模型能够在交互过程中调整策略。
这些路线分别解决了世界理解、状态推演和环境交互中的一部分问题。
面向真实机器人作业,单一能力很难独立支撑完整闭环。机器人需要理解当前环境,推演不同动作可能带来的结果,还需要将推演结论转化为可执行的动作,并在执行后判断任务是否符合预期。
行业由此开始走向行动一体化世界模型,将理解、生成和动作预测放入统一架构,使模型能够从生成未来画面进一步走向预判行动对世界造成的真实影响。
开悟世界模型 Kairos 3.1,理解 - 生成 - 预测一体化世界模型
大晓机器人发布的 Kairos 3.1,正是沿着这一路线展开的系统化探索,其融合了生成智能、物理智能和认知智能。
生成智能用于建立物理世界的内部表征,使模型能够刻画当前环境,并生成未来可能出现的状态。物理智能负责理解动作与结果之间的因果关系,在平行空间中推演不同动作路径。认知智能则负责处理复杂指令,完成长程任务理解、步骤拆解和策略规划。
开悟世界模型 3.1 通过原生统一架构融合世界理解、内容生成和动作预测三项能力,并在此基础上构建可持续自进化的智能闭环。
依托混合 Transformer 架构和混合共享注意力机制,多源信息被压缩至统一的隐空间,形成高密度特征表征,从而打通理解、生成和预测。
开悟世界模型端侧控制本体演示
从理解世界,到推演行动
开悟世界模型 3.1 的核心能力,可以概括为理解、生成和预测。
首先是理解。ACE-BRAIN-0.5 作为 Kairos 3.1 的空间理解核心底座,为系统提供感知与认知根基。
截至目前,ACE-BRAIN-0.5 已累计斩获十二项全球基准测试 SOTA,单一模型实现全维度能力跻身全球第一梯队。
物理生成层面,Kairos 3.1 构建了高保真、可交互的数字平行世界,为机器人的脑海推演提供了真实可信的仿真底座。其数据基础设施包含约 30 万套中国住宅平面图、5000 个全屋仿真场景和 8700 个高质量 3D 资产。每个物体均具备几何、尺度、材料、力学和功能等物理属性,为机器人提供大规模训练和测试环境。
最后是预测。机器人在真实行动之前,可以在模型内部生成多条候选轨迹,推演不同动作可能带来的结果。
这种能力让机器人不再依赖单次尝试。面对复杂任务,它可以先推演行动后果,再执行经过筛选的策略,从而提高成功率,降低真实世界中的试错成本。
世界模型开始进入机器人端侧大脑
要让世界模型真正驱动机器人,还要解决推理速度和部署成本。
如果机器人每完成一次环境理解和动作预测,都需要把数据上传到云端等待返回,通信延迟和网络波动就可能影响连续作业。
Kairos 3.1 因此进一步推进了世界模型的端侧部署。
数据显示,在 NVIDIA Jetson Thor 平台、BF16 精度下,Kairos 3.1 8B 平均推理延迟为 125 毫秒,推理速度达到经典 VLA 模型水平。
最后,Kairos 3.1 还有一套状态反思机制,如果出现操作失败,系统会精准定位问题节点,触发反思机制并调用平行空间推演能力,重新生成动作轨迹,然后再次执行。
基于理解、生成、预测三大能力的原生一体化融合,Kairos 3.1 形成的理解拆解 - 平行推演 - 动作输出 - 真机执行 - 评估反思 - 迭代进化的完整自进化闭环,让机器人大脑在真实作业中持续迭代、越用越强。
信息密度定律,什么样的数据才能让机器人变聪明
世界模型对物理世界的理解,建立在高质量数据之上。
大晓首次提出具身智能信息密度定律,并根据信息密度将具身数据划分为 L1 至 L5 五个等级。L1 和 L2 主要包括前视单目或双目视频,以及文字标注。L3 和 L4 在此基础上增加了全向环境感知、手部与身体姿态估计、多场景覆盖和长程任务数据。L5 进一步加入精细的力触觉信息、失败后的恢复数据,以及开放环境中的连续交互数据。
大晓认为,当数据达到这一信息密度,模型才更有可能表现出跨任务泛化、自我反思和策略提升等能力。
基于这一判断,大晓推出了环境式数采方案 2.0,由 ACE Ego Kit、ACE Data Engine 和 ACE Ego Matrix 三部分组成,分别承担高密度信息采集、工业化自动标注和异构数据统一等任务。
ACE Ego Kit 设备采用头、手、胸三位一体的分体式设计,用于同时捕捉第一视角环境信息、手物交互细节和全身运动状态。
其中,ACE Sense Glove 将三维力触觉感知与手部动作捕捉集成在一副手套中,力触灵敏度达到 0.01 牛顿,关节角误差控制在 2 度以内。
ACE Data Engine 把连续作业转化为可训练数据,该平台具备标注维度完整、精度较高、支持长程任务等特点。针对手部姿态估计困难环节,大晓提出生成式 4D 手部动捕方法 ACE-ViDiHand,在遮挡、快速移动和复杂动作场景中取得了 0.997 的帧级准确率,将误差降低 27 倍,动作平滑度提升 4.8 倍。
ACE Ego Matrix 让真人数据与跨本体数据能够复用。获得不同来源的数据后,如何完成统一和融合,是具身模型训练面临的另一项挑战。
真人采集数据与机器人真机数据之间,存在差异,ACE Ego Matrix 由此承担了具身数据标准化的工作。
它通过统一空间坐标、本体结构、动作时序和数据质量,使真人数据和不同机器人本体产生的数据能够进入相对统一的表达空间,为跨本体训练和数据复用提供基础。
基于这一数据体系训练的 ACE-Ego-0 模型,在 RoboCasa 和 RoboTwin 2.0 等评测中取得了领先结果,展示出面向不同任务和环境变化的鲁棒性。
从高密度环境数据,到自动化标注,再到跨本体数据统一,大晓机器人正在建立一套完整的数据基础设施。
从世界模型走进产业现场
世界模型最终需要进入真实场景,转化为能够持续工作的机器人系统。
大晓机器人此次带来了三套行业解决方案,分别是面向即时零售履约的晓满、面向酒店洗衣服务的晓新,以及面向全开放场景自主作业的晓途。
晓满主要服务前置仓、闪电仓、传统商超和仓店一体等业态。
该方案配套履约机器人 W1,针对即时零售 SKU 多、订单密、节奏快以及仓储空间狭窄等特点设计。W1 最小通行宽度仅 75 厘米,能够在密集货架之间移动,并通过力控机械臂和不同末端执行器,完成刚性商品、柔性包装等多种物品的拣选、装箱和搬运。
目前,该方案已进入 Sense MartGo 烧卖购、快客达等客户场景。
即时零售之外,酒店洗衣也是一个高频、刚需,却长期依赖人工的服务场景。晓新覆盖衣物收取、投放、洗涤、取出、分拣和折叠等环节,未来还计划进一步加入挂烫能力,形成酒店洗衣服务的全流程闭环。
借助 ACE-BRAIN 0.5 的空间理解、长程规划和状态追溯能力,机器人可以识别洗衣机舱门、旋钮、滚筒和衣物之间的空间关系,连续执行多个环节,并在步骤执行失败时重新定位问题、调整操作。
与零售前置仓和酒店洗衣房相比,开放环境的变量更多。晓途是一套面向开放场景自主作业的解决方案,目标是让机器狗实现 7×24 小时全天候自主运营。目前,相关机器人已经进入大型场馆和园区开展安防与设施巡检。
从机器人的大脑,到履约机器人 W1、四足机器狗,再到商品、订单和云端管理系统,大晓正在尝试打通模型、硬件与场景之间的完整链路。
世界模型,距离真正驱动机器人还有多远
大晓机器人没有把世界模型单独视为一个视频生成产品,也没有等模型训练完成后再寻找机器人场景。从项目开始之初,数据采集、模型架构、端侧部署和行业方案就围绕同一个目标展开,让机器人在现实环境中理解、推演并完成任务。
不过,世界模型真正驱动机器人的标志,不会停留在视频生成时长、模型参数或榜单名次上。它需要体现在机器人连续完成了多少真实任务,部署成本能否被客户接受,经验是否可以跨场景和跨本体复用。
背后更重要的变化是,世界模型产业正在告别单纯比拼生成效果的阶段。理解、生成、预测和行动之间的边界开始消失,模型正在进入机器人的控制回路,接受物理世界的实时检验。
对于大晓机器人来说,速度已经帮助它拿到进入牌桌的资格。
世界模型驱动机器人这件事,答案不会在一年之内就完全揭晓,但大晓机器人用 ACE 范式、Kairos 技术验证和晓满、晓新、晓途的产业落地,至少让大晓机器人成为这一轮世界模型路线讨论中不可忽视的参与者。
正如王晓刚在演讲结尾所说:大千世界,晓识万象。
大晓希望与产业伙伴共同推动物理 AI 进入真实世界,让具身智能逐渐成为兼具商业价值与社会价值的新型基础设施。
下一篇:电池寿命怎样比较购车决策更稳妥?