Skip to main content
Aggregate 雷锋网 人工智能 19 Aug 2026 - 16:30

英伟达 Cosmos 3 深度拆解:它想做具身智能时代的「安卓系统」| RSS 2026

RSS 官方收录 · 可信分层展示

关键摘要

当 AGI 的大脑决定向边缘迁徙,英伟达拿出了统治机器人进化的“终极剧本”。编辑丨岑峰 2026 年,大模型行业正经历一场前所未有的“体感位移”。那个在纯数字世界几乎无往不利的 Scaling Law,在试图跨越到物理世界时,正遭遇物理规律、空间约束和长尾数据的残酷审判。…

  • AI 行业最核心的矛盾正日趋明显:云端算力的指数级爆发,与机器人终端落地的步履蹒跚,构成了一种日益撕裂的鸿沟。
  • 这种割裂感,在 7 月悉尼 RSS 2026的最后一天,被推向了最高潮。
  • 在 “Robot World Models(机器人世界模型)” Workshop 上,传统机器人学界对物理因果的“敬畏”,正与 AI 工业界…

摘要引擎:抽取

正文提要

当 AGI 的大脑决定向边缘迁徙,英伟达拿出了统治机器人进化的“终极剧本”。

    编辑丨岑峰

                                                                                                       

2026 年,大模型行业正经历一场前所未有的“体感位移”。那个在纯数字世界几乎无往不利的 Scaling Law,在试图跨越到物理世界时,正遭遇物理规律、空间约束和长尾数据的残酷审判。

AI 行业最核心的矛盾正日趋明显:云端算力的指数级爆发,与机器人终端落地的步履蹒跚,构成了一种日益撕裂的鸿沟。

这种割裂感,在 7 月悉尼 RSS 2026的最后一天,被推向了最高潮。在 “Robot World Models(机器人世界模型)” Workshop 上,传统机器人学界对物理因果的“敬畏”,正与 AI 工业界对规模效应的“迷信”正面交锋。

就在这场范式撞击的火山口上,英伟达物理AI专家Max Li,为我们拆解了其新发布的重量级产品——Cosmos 3

这不再仅仅是一个更逼真的视频生成器:它是全球首个在同一个 Transformer 架构下,彻底打通了文本、视觉、音频和动作全模态的世界基础模型。如果说过去两年的具身智能还处于“组装机”时代:开发者需要吃力地将视觉模型、语言模型和控制算法像乐高一样拼凑在一起,那么 Cosmos 3 的出现,则宣告了“整机一体化”时代的到来。

在现场演讲中,Max Li 还释放了一个明确信号:具身智能的下半场将不再属于数据中心,而是属于边缘侧。通过让 AGI 的大脑迁徙到 Jetson 等边缘设备上实时运行,英伟达正在终结机器人背着服务器跑的包袱。

这背后是英伟达作为算力霸主的终极野心:它不仅要做硬件的垄断者,还要做具身智能时代的“安卓系统”。它正试图通过定义一套标准化的“大脑与肢体”协议,让全球碎片化的机器人形态,都能在 Cosmos 的逻辑底座上实现统一进化。

以下是英伟达物理 AI 专家 Max Li 的演讲实录,AI科技评论基于原英文演讲内容进行了不改原意的翻译编辑:

演讲实录:Cosmos 3: An OmniModel of Text, Video, and Action for Physical AI

主讲人:Max Li | Nvidia

Max Li:感谢主持人的精彩介绍。很荣幸今天能在这里向大家展示我们最近的研究成果:Cosmos 3。这是一个面向物理AI的多模态世界基础模型。

在物理AI领域,目前最大的挑战之一就是数据。与计算机视觉智能体或大语言模型(LLM)相比,获取物理世界的数据会受到时间和空间线性特征的极大限制:我们无法像扩展算力那样轻松地去扩展物理数据。

这也是为什么我们认为,仅仅靠远程操作或合成数据是无法完全解决这个问题的,我们需要更核心的技术。因此,我们引入了世界基础模型(World Foundation Model)的概念,希望它能成为许多物理 AI 应用的真正基石。

世界基础模型的核心能力

同时,我们花了很多时间去思考:一个合格的世界基础模型究竟应该由什么组成?特别是从智能体的角度来看,一个模型应该如何与世界互动才能称得上是“基础”?我们认为有几个关键能力至关重要:

  • 理解世界(Understanding the World): 就像上一位讲者 Laura 提到的,如果你想从微波炉里拿食物,模型必须先理解当前环境的状态,否则根本无法下手。

  • 模拟未来(Simulating Outcomes): 智能体必须能够模拟执行特定动作后的结果。在真实世界中,试错成本极高,打破一个玻璃杯是不可逆的。但在计算机仿真环境中,你可以反复打破东西,成本为零。因此,模拟未来走向的能力非常关键

  • 执行动作(Taking Actions): 这也是很多机器人领域研究者最熟悉的环节,即把你的意图在真实世界中具现化。

正是基于这些思考,我们推出了 Cosmos 3。

Laura 刚才提到的思路很好,我们也深有同感。基本上,我们将所有模态都整合进了单个模型中:从文本、图像、视频、音频,一直到动作,并且能够生成所有这些模态。接下来我们可以深入看看 Cosmos 具体能做些什么。

首先是理解真实世界。例如,给定一段机器人执行任务的观测视频,我们的模型本质上可以像 VLM(视觉语言模型)一样运行,去推理从什么时间到什么时间发生了什么,或者对观测结果进行预测。我们认为理解世界是构建任何模型的基石,没有理解,就无法采取行动。

此外,我们认为生成能力同样关键。我们选择将音频、视频和动作放在一起进行联合建模。在这个示例中,音视频的生成其实是验证模型的一种方式,让我们能够确信模型在特定的控制和条件输入下,对未来的结果有着正确的理解。其中,引入音频条件尤其有趣,因为在物理交互中,很多线索(比如碰撞、摩擦)是通过音频观测来提示的。这也是我们将音频纳入基础模型训练的原因。

在世界模拟方面,这里有一个 Cosmos 模拟人类与世界复杂交互的例子。左下角显示了头显相机的运动轨迹,右下角显示了手部姿态。模型模拟了人把某个东西加热然后放到桌上的全过程。

我们坚信,第一人称视角(Ego-centric)数据是基础模型获取物理交互深度知识的最有效途径。我们正与许多团队和开源社区合作,将这类知识注入模型中。

此外,我们还实现了反向动力学(Inverse Dynamics)。这不仅是指给定动作来预测未来的视觉观测,还能通过多视角观测,反推驱动这些视觉变化的底层动作是什么。如果你有海量没有配对动作标签的视频数据,这可以作为一个极佳的数据挖掘工具。在这个例子中,我展示了如何用预测出的动作去驱动这个机器人(Robot)的 URDF 模型,从而让机器人向前移动。

当我们对所有可能的物理结果(如动力学、视频演变、文本理解等)进行了足够充分的建模后,这个模型就可以直接转化为一个策略模型(Policy Model),在现实世界中执行动作。

虽然目前展示的 Demo 可能不是最惊艳的,但其核心逻辑在于:只要模型对状态及其转移机制的建模足够深刻,它自然就具备了策略能力,能够接收特定指令并在现实世界中执行。

模型矩阵、边缘端优化与在线评测

在 Cosmos 发布时,我们推出了现成可用的不同版本:比如面向服务器端的超大模型(Super 系列),但它们对许多机器人实时任务并不友好。因此,我们花了很多精力开发了 Cosmos Edge端侧模型。我们发现它可以在 Jetson 等端侧设备上实现实时推理,而不需要服务器级的 GPU。这对于该领域的广大开发者来说应该会非常实用。

另外,自发布以来的一个新进展是,我们与 Pi 团队合作展示了策略评估(Policy Evaluation)的可能性。我们并不是说现在就可以完全取代真实世界的评估,但我们确实可以把一部分评估工作离线化,并在这方面取得了很好的进展。策略可以与 Cosmos 进行交互,利用 Cosmos 的逆动力学能力来做一些非常有趣的事情。屏幕上方展示的是真实世界中的策略表现;而在在线策略评估期间,它决定不把球放进垃圾桶,导致任务失败——但这正是我们目前技术已经能够模拟和评估出来的。

前面提到了很多内容,这段视频对我说过的话做了一个总览:包括 VLM 能力、粒子跟踪(Particle Fit)、移动(Move it)、图文视频音频的输入输出、全局策略、前向动力学模型、逆动力学模型等。我们只是在不同的输入和输出组合上进行配置,使得单个模型就能把它们全部打通。

接下来进到技术细节部分:我们是如何实现的?聊聊架构。

基本上我们把模型分为两部分:

1.推理器(Reasoner): 负责理解世界,你可以把它看作一个 VLM。

2.生成器(Generator): 负责跨模态的生成(视频、音频和动作)。

这是一个 MoE(混合专家)架构。在注意力掩码(Attention Mask)的设计上,我们在进行世界理解(推理)时采用因果自注意力(Causal),而在生成时则采用双向注意力(Bi-directional)。

作为一个机器人技术会议,我必须提一下我们是如何在不同的具身(Embodiments)之间统一动作矢量的。我们支持各种形态:包括左上方显示的汽车(AV)、相机运动(第一人称运动)、单臂机器人、双臂机器人以及人形机器人。我们使用了一些启发式规则将不同的动作向量耦合在一起,使它们在语义空间中尽可能地共享。

我们通过三种模式进行训练:

  • 动力学模式(Dynamics Mode): 给定动作,预测未来的视频。

  • 逆动力学模式(Inverse Dynamics Mode): 给定视频,预测导致其发生底层的动作。

  • 策略模式(Policy Mode): 基本上是对视频和动作进行联合训练的过程。

处理不同模态时,一个棘手的问题是如何处理模态之间的位置编码(Position Embeddings)。这是我们提出的方案,以便将所有内容做统一:

  • 语言(Language): 采用非常标准的模式。

  • 视频(Video): 我们在 P , H , W(我们选择将其定义为 3D 空间)所有维度上递增索引,在水平和权重轴上进行编程。

  • 音频与动作(Audio & Action): 因为它们没有高和宽(H 和 W),我们仅使用时间轴。

通过这种方式,所有深度生成都能一直兼容到大语言模型的底层循环中,尽可能保留大模型的通用基础知识。

但这里有个难点:语言的 Token 是没有时间概念的,而你必须处理视频、音频和动作的时间同步。我们的做法是:选择 24 FPS 作为基准线。当输入不同帧率的视频时,我们会基于 24 FPS 重新计算它们的索引,从而让所有内容在真实时间轴上对齐,而不是产生偏差。

数据集规模与训练阶段

关于数据,我们在预训练阶段为推理器筛选了大约 2200 万个可训练样本,涵盖 OCR、视觉定位等多个领域。在监督微调(SFT)阶段,我们提取了其中专门针对物理 AI 的子集。

在生成器端,拥有大约 220 万个样本,并经历了三个训练阶段:

1.预训练: 主要是图像生成、视频生成以及图生视频(I-to-V)。这部分预训练数据折合大约 1000 万小时的视频(做个转换方便大家对数据量有个直观的概念)。

2.中期训练(Me-training): 我们引入了额外的模态,特别是动作,以及在机器人领域非常流行的跨域传输数据。例如,我们会生成资产仿真视频,虽然它在仿真里看起来很假,但我们可以对其进行渲染,使其达到照片级真实,同时不改变视频的物理特性。我们也把这些数据包含在内。

3.后期训练(Post-training): 论文发布时我们只训练了 Nano 和 Super 版本。我们对其进行了文生图、文生视频、图生视频的后训练,以及一些与在座各位更相关的部分——即专门用于策略输出的策略模型,好让大家了解 Cosmos 如何转化为策略以及它如何工作。

我想再着重强调一下 Cosmos 的家族规格:

  • Cosmos Edge: 这是一个 4B(40亿)参数的 MoE 模型,包含两个专家塔(每个 2B)。

  • Cosmos Nano: 一个 16B 参数的 MoE 模型(推理器和生成器各 8B)。

  • Cosmos Super: 我们最大的版本,64B 参数的 MoE 模型(各 32B),用以服务不同的应用场景。

我们看到了非常清晰的扩展定律(Scaling Law)。这里先不谈策略(因为策略需要满足实时性),但在图像和视频生成上,更大的模型有着极其明显的优势。

最后也非常重要的一点:Cosmos 是完全开源的。我们尽量做到尽可能的开放。我鼓励大家去看看我们的项目,而且我会坚持手动去回复 GitHub 上的所有 Issue。没有用任何 AI Agent,真的是我本人手动回复。我每天都在抽时间研究模型和不同代码里到底存在什么问题。所以如果大家有任何疑问或遇到 Bug,请告诉我们,在每天 24 小时的时间限制内,我会尽全力为大家提供支持。

我们发布了模型、代码,还发布了一篇非常长的论文,但我们尝试在里面塞入了尽可能多的细节。这也是一项惊人的通力合作,有超过 100 人共同参与,才最终诞生了 Cosmos。我们希望它能为社区未来想要开发的许多应用打下坚实的基石。

以上就是我的全部演讲,非常乐意回答大家的问题,谢谢!

现场 Q&A

主持人:非常感谢 Max 的精彩演讲。我想先问一个问题:你们把所有模态都塞进了一个超大模型里,那么是否有证据表明,这个大模型确实缩小了动作落地差距(Action Grounding Gap)?最终由该策略(特别是端侧的 Edge 版本)生成的动作,是仅仅“看起来可行”,还是在物理上真正切实可行?

Max Li:这是一个非常好的问题。如果你读过论文,里面会有更详细的内容。例如,在 Cosmos 的预训练阶段,我们完全没有包含任何 PID 控制信息之类的数据。它纯粹是作为一个状态转移机器(State Transition Machine)来进行训练的。

直到后期训练(Post-training)阶段,所有的控制信号才被引入。当我们在进行针对特定机器人的联合后训练时,我们把控制信息加了进去,这时它才真正变得实用。这里面其实包含了一些哲学思考:我们发现,预训练应该尽可能地保持通用性和泛化性,而通过后训练来让它在特定任务上真正变得有用

观众提问:请问如何衡量 Cosmos 在物理规律上的精确度?我指的是在视频生成过程中,如何测量预测的物理走向与现实物理规律之间的差距?

Max Li:是的,我们使用了一些特定的基准测试(Benchmarks)来进行物理评估,比如 VBench 等,这些工具是专门为了评估生成视频的物理合理性而设计的。

至于将“动作”纳入建模是否提升了物理精确度——虽然在这一版迭代中,我们还没有拿到极其强烈的全局统计数据,证明加入动作能提升所有领域的视频物理预测(因为毕竟不是所有互联网视频都带有机器人动作标签),但我们确实观察到,在机器人和具身智能相关的特定领域,引入动作显著提升了模型对未来视觉走向的预测精度。在这些场景下,该模型被证明是非常有帮助的。

观众提问:非常感谢您的演讲。我注意到 Cosmos 模型有不同尺寸的多个版本(如 Edge, Nano, Super),同时您也提到训练这个模型使用了数百万小时的视频数据。那么,你们在训练不同尺寸的模型时,使用的是不同数量的视频数据,还是说所有模型使用的数据量是一致的?

Max Li:非常深刻的问题。通常在研究扩展定律(Scaling Law)时,你会希望确保 Token 的数量能与你的参数量保持合理的比例(Compute-optimal)。但对于端侧模型(Edge Model),我们确实不得不做出一些权衡和妥协。

例如,在 Edge 模型中,我们彻底砍掉了音频模态。因为我们发现对于大部分端侧任务来说,音频并非必需,而且砍掉它能腾出更多资源;但当我们把模型扩展到 16B(Nano)和 64B(Super)时,就不会遇到这种资源受限的问题。

这是一个非常好的痛点,也是一个非常开放性的课题:在做这种技术权衡时,完全取决于你手头的数据。因此,我的经验由于数据不同,可能无法直接复制到其他团队的经验中。但总体而言,是的,在不同的模型体量之间确实存在一些数据和模态上的权衡。我依然坚信模型越大效果越好,希望我们未来能真正训练出一个终极的物理 AI 基础模型。

一个人读论文太孤单,一群人刷顶会才好玩。

RSS 2026 召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪硬核技术探讨,拒绝灌水。

? 进群传送门: 扫码进群或添加微信Luyoyo_2026,备注:论文群 + 关注的 AI 方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击阅读原文关注雷峰网专区。

打开官方原文 站点原文页 可信分区 本信源更多 今日简报 分享图 RSS 稍后再看列表