Skip to main content
Aggregate 雷锋网 人工智能 24 Aug 2026 - 20:30

WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线

RSS 官方收录 · 可信分层展示

关键摘要

8 月 19 日下午,世界机器人大会分论坛“具身智能大模型的进化之路:从技术分级到产业落地”在北人亦创国际会展中心举行。生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军发表主旨演讲,发布团队最新研究成果,并系统阐述通用世界模型的五级发展路线。…

  • 朱军表示:“从大模型发展的视角来看,我们希望构建的,不只是服务于某个任务或场景的专用模型,而是一个能够理解世界、预测未来并采取行动的通用基座…
  • ”从第一性原理出发,定义通用世界模型世界模型已经延伸到视频生成、环境模拟、机器人决策和动作控制等方向,但行业对“什么样的世界模型才称得上通用…
  • 人在学习骑自行车或开车时,会从最初的不协调逐渐变得稳定、准确。

摘要引擎:抽取

正文提要

8 月 19 日下午,世界机器人大会分论坛“具身智能大模型的进化之路:从技术分级到产业落地”在北人亦创国际会展中心举行。生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军发表主旨演讲,发布团队最新研究成果,并系统阐述通用世界模型的五级发展路线。

朱军表示:“从大模型发展的视角来看,我们希望构建的,不只是服务于某个任务或场景的专用模型,而是一个能够理解世界、预测未来并采取行动的通用基座模型。”

从第一性原理出发,定义通用世界模型

世界模型已经延伸到视频生成、环境模拟、机器人决策和动作控制等方向,但行业对“什么样的世界模型才称得上通用”仍缺少共识。

人在学习骑自行车或开车时,会从最初的不协调逐渐变得稳定、准确。其重要原因,是大脑在与外部世界持续互动的过程中,形成了一个关于世界如何运行的“内部模型”。

通用世界模型同样需要三项彼此关联的能力:

“通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统。”朱军强调,行动不仅是模型的输出,还会改变环境、产生新信息,并进入下一轮理解、预测和决策。

 

数据、架构与算力:构建通用世界模型的三大要素

要想构建通用世界模型,仍然离不开大模型的三个基本要素:数据、架构与算力。

在数据方面,通用世界模型需要一个由观察逐步走向行动的多层数据金字塔:从海量网络视频开始,逐步扩展到特定领域视频、第一视角人类视频、带动作记录的人类示范,以及真实机器人交互数据。

越靠近底层,数据规模越大、覆盖面越广;越靠近顶层,数据虽然更稀缺、成本更高,却能更直接地建立任务、动作与物理结果之间的联系。合成数据可以贯穿金字塔的每一层。同时,“不完美数据”同样具有重要价值:失败尝试、纠正动作和恢复过程都包含有效的学习信号,能够帮助机器人学习如何从失败中恢复。

在架构层面,通用世界模型需要统一处理图像、视频、语言和机器人动作等不同模态信息。MoT(Mixture-of-Transformers)通过为不同模态配置专属参数,并以共享注意力实现跨模态信息交互,使环境理解、世界状态预测与动作生成能够在同一模型中协同完成。生数科技的世界动作模型 Motubrain 正是基于这一架构,将理解、预测与行动统一建模,打破传统分模块方案的能力割裂,同时提升异构数据的利用效率和跨任务迁移能力。

算力则同时影响大规模预训练和实时部署。离线视频生成可以容忍一定等待时间,但实时交互和机器人控制必须在环境发生变化之前完成预测和决策。因此,训练基础设施、推理加速、模型蒸馏和高效注意力机制,都是通用世界模型走向实际应用的重要支撑。

通用世界模型如何进化?五级路线图明确进阶方向

从通用基座模型的目标出发,通用世界模型可以划分为五个逐级演进的层级。它们并不是彼此割裂的产品方向,而是随着对世界的理解不断加深、与世界的交互不断增强,模型自主性持续提升的过程。过去几年,生数科技的研发与落地实践已经覆盖其中前三个层级。

 

L1:世界生成(World Generation)

第一步,是让模型学会生成连贯的世界演化过程。视频正是这一阶段最典型的载体,它帮助模型学习对象、运动、空间关系和时序变化,为进一步理解和预测世界奠定基础。

2024 年,生数科技推出视频生成大模型 Vidu,通过持续提升视频质量、时序一致性和世界动态建模能力,完成了 L1 阶段的初步实践

L2:与世界交互(Interactive World)

在生成能力之上,模型开始接收实时输入,并根据语言、语音或控制信号持续改变后续内容,从“一次生成”走向“持续互动”。

2026 年 7 月发布的 Vidu S1 将这一能力推进到实时交互阶段。用户可以通过语音实时介入生成过程,持续影响接下来发生的内容,让模型能够根据外部输入动态演化世界。

L3:在世界中行动(Actionable World)

再往前一步,模型开始从数字世界进入物理世界。此时,环境理解、未来预测和动作生成需要真正统一起来,让模型不仅能判断世界发生了什么,还能直接生成机器人可执行的动作,并根据真实反馈持续修正。

Motus 和 Motubrain 标志着生数科技从视频生成进一步走向物理行动。Motus 于 2025 年 12 月发布并全面开源2026 年 4 月发布的 Motubrain,则进一步将环境理解、世界状态预测和动作轨迹生成统一到同一个模型中,推动通用世界模型从“视觉推演”迈向“物理决策”。

相较 Motus,Motubrain 的推理速度提升约 10 倍,适配新的机器人本体时,仅需 50 至 100 条人类示范数据。在 RoboTwin 2.0 基准测试中,其成绩达到 96.1 分,位居榜首。目前,Motubrain 已在包括银河通用、星尘智能、千寻智能等近十种本体上完成验证,展现出在长程任务、多任务场景和不同机器人形态之间的泛化能力。

L4:自主世界智能体(Autonomous World Agent)

具备真实行动能力之后,模型还需要进一步走向自主决策,能够围绕长期目标主动感知环境、拆解任务、探索未知状态并持续规划行动。

L5:世界组织者(World Orchestrator)

在更高层级上,模型不再只控制单个智能体,而是能够统筹机器人、数字智能体、人类、工具及其他资源,完成更复杂的任务分配与多智能体协作。

从 L1 到 L5,能力层层递进。没有对世界演化规律的学习和预测,就难以形成稳定、连续的交互;没有真实行动带来的环境反馈,也很难进一步发展出自主学习、长期规划和复杂协同能力。

面向 L4、L5,还需突破六项关键挑战

目前,L1 至 L3 已经形成较为具体的技术实践,但距离更高阶的世界智能仍有差距。视频模型仍需持续提升生成质量、可控性与时空一致性;世界动作模型则需要在更复杂、更开放的真实环境中,进一步提升稳定性、泛化能力与执行效率。

继续迈向 L4 和 L5,还需要突破六项关键挑战:

围绕这一方向,生数科技将持续强化世界生成、与世界交互、在世界中行动三个层级,并进一步补齐目标形成、主动探索、持续学习和长期记忆等能力,为更高阶的自主世界智能体奠定基础。更长远的目标,是构建一个能够持续理解世界、预测不同行动的后果、在明确约束下自主行动,并从真实反馈中不断学习和进化的通用基座。

当理解、预测与行动真正形成闭环,世界模型也将不再只是生成内容的模型,或执行任务的机器人策略,而会成为连接数字世界与物理世界、迈向通用具身智能的重要基础。

博客链接:https://www.shengshu.com/zh/general-world-model/

打开官方原文 站点原文页 可信分区 本信源更多 今日简报 分享图 RSS 稍后再看列表