最新下载
热门教程
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
宇宙3边引入
时间:2026-07-21 17:18:57 编辑:袖梨 来源:一聚教程网


真实的世界是广阔的,在其中操作物理AI系统需要了解一个场景是如何变化的,预测接下来会发生什么,并确定一个行动将如何影响世界.
机器在工厂,仓库,医院等边缘运作. 要了解这些环境并采取行动,它们需要提供数据中心的模型-在内存受约束的系统中的一级性能。
今天,我们将释放NVIDIA Cosmos 3 Edge 在Hugging Face上的Cosmos 3存储器。 它是一个40亿参数的开放世界模型,帮助机器人和视觉AI特工了解他们的周围环境,实时理性,并在边缘设备上产生机器人动作.
下载模式:https://huggingface.co/nvidia/宇宙3-Edge
该模型通过NVIDIA边缘计算机,包括NVIDIA RTX PRO GPU,NVIDIA DGX,NVIDIA GeForce RTXTM GPU,NVIDIA Jetson,包括新公布的Jetson T2000和T3000模块,提供内存高效的高通量推论.
设计为紧凑的开放型号,可用作小型视觉语言型号(VLM),具有最佳级吞吐量,精度可实时推论.
作为训练后的世界行动模型(WAM),宇宙3边缘以机器人控制分辨率(640×360观测)运行,提供实时推理,并在NVIDIA Jetson Thor的推论上生成32个动作——同时在15Hz实现实时控制.
在类似大小(4B参数)模型中,Cosmos 3 Edge在VANTAGE-Bench上排名#1,用于视觉分析,以及机器人政策学习的先进技术,为智能基础设施和机器人设定了艺术状态.
世界模特儿是什么?
一个世界模型学习一个环境如何随时间而变化。 它代表物体,运动,空间关系,和行动的效果.
考虑一个机器人到达一个物体。 认识物体只是第一步。 机器人还必须了解物体的位置,它的钳子是如何移动的,接触发生时会发生什么,以及哪些动作最有可能成功完成任务.
一个世界模型帮助机器人解释这些关系. 它可以预测一个动作的视觉结果,推断引起变化的动作,或者产生一个动作来产生预期的结果.
Cosmos 3 Edge将这些能力汇集在一个模型中,在探测器上. 其共享的表示使物理AI系统能够了解当前的世界状态,模拟可能的未来,并将这些未来与行动联系起来.
两个变形塔,一个共用代表
Cosmos 3结合了两个变压器塔:
- 自动回转塔:用于理解和推理的处理视觉和文本符号.
- 散射塔:用于预测,生成,神经模拟的过程视觉,音频,和行动符号.
两座塔台分别维持了正常化层和多层感官. 它们共享多模式关注层,使信息在语言、视频、音频和行动中保持一致。
这种设计允许模型在生成输出前对一个场景进行推理. 视任务而定,Cosmos 3可以从自递式塔产生推理符号,也可以从扩散式塔产生去声的视频和动作符号.
关注模式也适应于每一种信息. 语言使用因果注意,即每个符符都注意它之前的符符. 传播信使更广泛地关注现有情况,支持一致的预测和生成。
这些组成部分共同使模型能够共同反映正在发生的情况、今后可能发生的情况以及行动如何影响结果。
共同代表行动
物理系统对动作的描述不同. 车辆可能通过自我姿态和行动来代表一种行动。 相机使用相机运动. 机器人手臂使用其末端效应器的姿势,而手或抓手也需要代表抓取状态.
Cosmos 3将这些不同的化身描绘成共同的动作表现.
动作编码为紧凑的几何向量,可以捕捉:
- 操纵状态
这就形成了控制与世界视觉结构之间的直接联系. 该模型可以将像素的变化与物理运动,空间关系,以及控制输入联系起来.
因此,生成的视频变得不仅仅是视觉预测. 它能够代表世界将如何因应某项行动而改变。 这使开发人员在运动、控制以及因果基础上培训数据。
政策模式
作为一项政策,Cosmos 3预测一项行动及其预期的视觉后果.
该模型可以生成系统应该做的,模拟接下来可能发生的事情. 这直接将世界建模与机器人政策培训和评价联系起来.
目前状态、行动和视觉后果。
这些模式使一种模式能够学习因果和政策。 动作可以双向流经模型,使得宇宙3边缘可以预测动作的效果或者从效果推断动作.

提示:拿起香蕉放进盘子里.
我们还在发布Cosmos 3 Edge Policy(DROID):一个机器人操纵政策,在DROID数据集上经过培训,用于选址任务,并附有培训后的脚本.
开发者在部署到NVIDIA边缘和加速计算平台之前,可以使用H100或NVIDIA DGX站的一小组,高效地微调宇宙3边缘的目标工作量.
训练有素的样品,以改善业绩
除了这些基础模型之外,我们正在发布经过培训的参考检查站和培训食谱,以帮助开发人员调整和优化Cosmos 3,用于自己的应用.
Cosmos 3是一个开放的世界基础模型平台. 由于模型在经过培训后有高质量的、针对具体领域的数据,其准确性继续提高,用于专门应用。 宇宙是利用开放框架建立适合域的世界模型的起点。 后培训使开发者能够提高模型性能,同时保持输出质量. 为了展示这个工作流程,我们还发布了Cosmos 3 Super 4-Step Distillation检查点以及培训后的脚本,为64B模型提供了更快的参考执行,帮助开发者将Cosmos适应自己的领域,实现更好的下游性能.
Cosmos 3 Super 4-Step(Text-to-Image & Image-to-Video): 宇宙3 超级4-Step(Text-to-Image & Image-to-Video): 宇宙3 超级4-Step(Text-to-Image-Image-to-Video) 宇宙3 宇宙3 超级4-Step: 这些是分配匹配的检查点和脚本,它们将传播从35-50去诺步骤减少到4,在保持图像和视频质量及忠诚的同时,提供最多25x更快的推断。
这些例子可作为开发者可以借鉴的参考执行. 使用开放的训练脚本,可以后训练Cosmos 3 Edge用于定制机器人政策,也可以蒸馏Cosmos 3 Super用于更快的图像和视频生成,适合您的应用.
尝试宇宙三边
Cosmos 3 Edge通过共享的世界代表将理解,预测,模拟和动作联系起来. 开发者可以将其部署在更接近其传感器的设备上. 该模型可用作诱因器或动作生成器.
使用开放的宇宙框架来定制和专门化模型.
检查宇宙3:https://huggingface.co/collections/nvidia/宇宙3
我们继续推进Cosmos 3的物理AI, 即将改进互动世界代、驱动情景模拟和机器人政策。
我们还在投资于更快的推论和在范围更广的硬件上更有效的后培训,减少建设下游模型所需的时间和计算。
这包括优化Cosmos 3检查点,并开放推论和优化vLLM等框架,很快将有更多的优化和开发工具。
第1条中提到的模式
第1条所述的收款
相关文章
- 检疫区最后一站结膜炎与红眼区别一览 07-21
- 超大杯研究员的异常求汁欲第二章流程及单词出处 07-21
- 斗罗大陆诛邪传说什么时候上线 07-21
- 原神八重神子选精通沙还是攻击沙好 07-21
- 我不是盐神网站入口在哪 07-21
- 冒险者旅馆2全流程通关攻略是什么 07-21