最新下载
热门教程
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
游戏引擎将死:世界模型奇点临近:Matrix -Game3.5引领游戏世界开源模型第一品牌
时间:2026-07-21 18:21:56 编辑:袖梨 来源:一聚教程网
7月19日,在2026世界人工智能大会(WAIC)“世界模型与多模态范式革命”专场论坛上,
昆仑万维正式发布并开源新一代可交互世界模型Matrix-Game 3.5
。昆仑万维董事长兼CEO方汉在论坛上宣布,2026年是“世界模型元年” ,国产世界模型将迎来重大突破。Matrix-Game 3.5正是这一时代节点下的重磅力作,持续引领游戏世界开源模型第一品牌。

本次论坛上,昆仑万维集中完成三大核心模型的全球首发与重磅升级,涵盖世界模型、音乐创作、AIGC等核心领域。其中,Matrix-Game 3.5 是面向开放世界交互的新一代世界模型,通过 Patch Memory 与 Warped PRoPE 实现长期记忆、几何一致性建模和精准相机控制,显著提升了长时序生成、开放场景泛化与实时交互能力。
1
多重核心技术突破,重新定义世界模型能力边界
从游戏出发,但不止于游戏。Matrix-Game 3.5的能力正在向真实场景延伸。以下是它最核心的五个技术突破,每一个都对应着一个曾经被认为“很难搞定”的问题。
1.
"Patch Memory":让AI第一次学会了“记住”
如果你让一个世界模型生成一段长视频——镜头穿过走廊、拐过弯、推开一扇门——前几秒可能一切正常,但几分钟后问题就来了:当你让镜头再回到最初的位置,墙上的画可能消失了,桌上的杯子换了颜色,甚至整面墙都变了模样。这不是偶然的“失误”,而是世界模型最头疼的顽疾——
它没有长期记忆
。
此前的世界模型是怎么“记”东西的?把整帧画面原样存下来。听起来简单直接,但实际操作中问题很大:镜头一转,画面里所有物体的位置全变了,模型就认不出来了——同一张桌子,从左边看是一个样子,从右边看是另一个样子,模型会以为这是两个不同的东西。评测数据显示,主流世界模型的“物体重现得分”没有一个超过0.6分(满分1分)。谷歌Genie 3的记忆时间最长也仅约一分钟。

Matrix-Game 3.5换了一个思路:不存整张“照片”,而是把画面切碎成无数个小块(Patch),每个小块带上它在三维空间里的精确坐标——它离相机多远、在空间的什么位置。当镜头重新对准某个方向时,模型不是去翻历史画面,而是直接在三维空间里检索:“这个坐标附近,我之前见过什么?”找到后,再把那些小块对齐到当前视角。
这个机制就是“
Patch Memory”
。它的本质是从“存画面”升级为“存空间”——模型记住的不是“某帧画面长什么样”,而是“某个三维位置有什么东西”。当相机离开再回来,它不再依赖模糊的画面相似度去猜,而是
通过几何计算准确找回此前观察过的每一个空间角落
。
听起来像是很自然的思路?但实现它的难度,相当于推翻了原有的记忆架构重新设计。团队需要为每一帧画面估计相机位姿、米制深度、相机内参,再把无数个图像小块提升到三维空间、做遮挡判断、做可见性检索……任何一个环节掉链子,整个记忆就会“串味儿”。
最终的效果是:Matrix-Game 3.5生成的demo,镜头在复杂场景里往返多次,每一次重访,场景中的建筑、植被、路标都和最初完全一致。
“物体消失”这个困扰行业
许久
的问题,第一次在真正意义上被解决了。
2.
PRoPE+Warped RoPE:让AI真正读懂视角与空间的关系
如果你玩过一些AI生成的3D游戏,可能会有这样的体验:你转动视角,画面跟着变了,但总感觉哪里“不对劲”——明明应该看到建筑物侧面的细节,生成的却是一片模糊的涂抹;明明转身往回走,原本的物体却像被“重置”了一样,位置产生了微妙偏移。
问题出在哪儿?传统视频模型使用的3D RoPE位置编码,只记录了“这一帧在时间轴上的第几秒”和“这个像素在画面里的横纵坐标”。这就像一个人只知道“我在这个房间的哪个位置”,却不理解“这个房间有多大、家具怎么摆的、从不同角度看去长什么样”——当视角大幅变化时,模型就“懵”了。
Matrix-Game 3.5的解决思路是:
让位置编码学会“几何”。

团队改进PRoPE机制
(
相机位姿相对编码
)
,不再把相机参数当作一个额外输入,而是直接把相机投影矩阵编码“揉”进Transformer的时空位置表示里。这样一来,Attention在建立跨帧关联时,不仅能判断“这个像素离那个像素有多远”,还能感知到不同视角之间的旋转、平移和投影关系。通俗点说:
模型知道了“相机是怎么转过来的”
,生成的画面自然更稳、更准。
除了PRoPE机制,我们进一步提出
Warped RoPE
,重新定义不同类型 Token 的时空位置,进一步解决了记忆复用时的坐标混乱问题。当模型从历史记忆中调取一个Patch时,传统做法是保留它原始画面里的坐标——这就等于把一张照片里的像素硬贴到另一个视角的画面中,位置对不上。Warped RoPE的做法是:重新计算这个Patch在“当前视角下应该出现在哪里”,然后赋予它新的时空位置。模型学习的不是“这个Patch从哪儿来”,而是“这个Patch现在该在哪儿”。
PRoPE 与 Warped RoPE 共同构成了 Matrix-Game 3.5 的统一几何编码框架。两者配合起来的效果是:
位置编码不再只是记录时间的“第几秒”和空间的“第几行第几列”,而是升级为一种具备几何语义的世界坐标
。
当相机快速旋转、拉近拉远、离开又回来时,模型不会“迷路”,生成的每一帧都在对的位置上。
3.
动静解耦记忆
:避免同一物体的不同姿态污染记忆
世界模型从“视频生成”到“可交互世界”的核心跨越,在于能不能“实时响应”——你动,它跟着变;你停,世界保持稳定。但实时性的前提,是记忆不能“打架”。
此前的世界模型在长期记忆上面临一个尴尬困境:动态物体和静态场景被混在一起写入记忆,结果一个移动的角色在不同位置被反复记录下来,模型逐渐“糊涂”了,以为同一个东西是多个物体,出现重影、错位,时间一长记忆就“污染”了。
Matrix-Game 3.5的解法是把这两件事拆开处理,各管各的。Patch Memory负责记住稳定的静态场景结构,主体参考Token负责维持动态主体的身份和外观一致性。动态物体在写入记忆前会被过滤掉,避免移动物体被误认为多个静态物体,从而减少重影和长时序记忆污染。
最终,两者共同支撑长时序生成的时空一致性。
4. 实时推理:720P 20FPS,真正可玩的交互世界
有了稳定的记忆,接下来要解决的是“快不快”的问题。高分辨率流式视频生成对推理速度提出了极高要求,团队从三个层面搭建了系统级加速方案:
模型吞吐优化
——通过蒸馏将采样步数压缩至3步,结合分块因果推理和KV Cache,在保证画质的同时大幅降低延迟;
DiT推理优化
——对FFN做INT8量化、优化记忆检索、引入Torch.compile,在不影响效果的前提下进一步压榨推理耗时;
VAE解码优化
——使用MG-LightVAE对Wan2.2的VAE Decoder做约75%的结构化剪枝,让VAE不再是拖后腿的瓶颈。
三层优化叠加的结果是:单张GPU、720P分辨率、约20FPS的实时流式视频生成。 20FPS不是“放视频”,是“活世界”——你操作,它响应,不卡顿,不丢失记忆,画面稳、反应快、跟得住。世界模型从此不再是离线渲染的“视频生成器”,而是一个真正可玩、可交互的“活世界”。
5.
自动化数据管线:让AI从“看视频”升级为“理解世界”
训练一个世界模型,光有视频是不够的。打个比方:你给一个人看一段行车记录仪的画面,他能看懂“车在往前开、左边有棵树、前方有个弯道”。但如果让AI看同样的视频,它看到的只是一堆像素在变——它不知道“相机在向前移动”,不知道“那棵树离我有多远”,更不知道“弯道的弧度是多少”。
互联网上的视频浩如烟海,但绝大部分对于世界模型来说都“不够格”。原因很简单:
缺少三维信息
。没有深度、没有相机轨迹、没有物理尺度,模型学到的只是“画面看起来像什么”,而不是“这个世界是什么样子的”。

团队做了一个看似“笨拙”但极其扎实的事情:
自己动手,给每一段视频补
课
。
他们先构建了一个多Agent系统,24小时不间断地在互联网上“巡游”——自动调研数千款游戏,从游戏类型、玩家评价、画面质量等多个维度综合打分,筛选出有训练价值的数据源。
找到视频只是第一步。更关键的是后续的自动化标注管线——系统会对每一条视频做三维重建,估算出相机在每一帧的位置和朝向(相机位姿)、画面中每一个物体离相机的距离(米制深度)、以及镜头的焦距和成像参数(相机内参)。原本只有二维像素的视频,被一层一层地“剥开”,注入了真实的物理尺度信息。
他们还设计了一套叫
"
Scene-Quality
"
的自动评估系统,给每一个场景做“体检”——从几何可重建性、画面清晰度、相机运动稳定性、动态目标比例等多个维度打分,判断这个场景到底值不值得拿去训练模型。评分低的直接淘汰,评分高的进入训练库。整个过程全自动,不需要人工一张张翻看。
这套数据管线的最终产出是:
超过500万段高质量视频切片、累计1万多小时有效训练数据、覆盖1200多个游戏场景
——每一段都带着精确的相机位姿、深度图和文本描述,可以直接“喂”给世界模型。
让AI理解物理世界,前提是给它看“带物理信息”的数据。这个道理朴素,但真正把它做成一条全自动、可规模化运转的工业级管线,团队是行业内走得最早、也走得最远的团队之一。
6.
轻量化、可迁移的交互框架:不堆参数,靠“巧架构”
行业里有一种惯性思维:想让模型更强,就堆更多参数。放在世界模型上,这个逻辑听起来合理——要理解物理世界、记住长期场景、支持实时交互,参数总得够大吧?
但团队做了一个反直觉的选择:
几乎不新增参数。
除了角色Reference Adapter之外,Matrix-Game 3.5的核心交互功能——PRoPE几何编码、Patch Memory长期记忆、相机控制、动静解耦——全部在原有模型架构的基础上实现,没有额外增加参数负担。这意味着什么?意味着模型没有变“重”,没有变“慢”,也没有因为引入新能力而牺牲原本擅长的东西。
这背后是一个更深层的设计考量:
模块化、可插拔、可迁移。
团队把交互框架做成了一套轻量化的“插件系统”——PRoPE负责几何感知、Patch Memory负责长期记忆、动静解耦负责稳定生成,每个模块独立工作、互不干扰,而且都可以快速适配到不同的视频基础模型上。今天跑在A模型上,明天换到B模型,不需要重新设计整个架构。
这种“不堆参数、靠巧架构”的思路,带来的实际好处是:
基础视频模型原生的开放内容生成能力被最大程度保留了下来。
引入交互能力之前能生成什么样的高质量画面,引入之后还能生成同样的高质量画面——不牺牲、不打折、不妥协。
这套框架的开源意义也在于此:全球开发者拿到的不只是一个“能跑的模型”,而是一套可以拆解、替换、移植到不同基座上的交互世界建模方案。一个人在一个基础模型上做的工作,可以惠及所有基于这套框架的衍生模型——这才是轻量化架构的真正价值。
2
开源路线:让世界模型从“少数人的游戏”走向“全行业的基石”
Matrix-Game从1.0到3.5始终坚持开源路线。3.5版本宣布核心架构开源,吸引全球开发者共建生态。Matrix-Game 2.0是实时交互式世界模型技术范式中首个开源的实现方案,Matrix-Game 3.0则首次系统性地将记忆问题纳入开源解决方案。
Matrix-Game的开源理念并非简单“开放代码”,而是通过轻量化、可迁移的交互框架设计,让全球开发者能够基于Matrix-Game 3.5快速适配不同视频基础模型,
在世界模型的基础之上构建各自的应用与创新
。
这种“开源核心架构+生态共建”的策略,正在推动世界模型从学术研究走向产业落地,从少数科技巨头的“专利”变为全行业共享的技术基础设施。
此前,
DiT作者、纽约大学助理教授谢赛宁团队基于Matrix-Game 2.0的开源底座
,发布了全球首个多人视频世界模型Solaris,也从学术圈的实际使用上印证了这套开源方案的基础模型价值。NVIDIA和浙大联合发布的工作Light Interaction基于Matrix-Game 3.0模型进行研发。另外,NVIDIA的SANA-WM和Adobe的RELIC等国际头部大厂世界模型工作均将Matrix-Game相关模型作为对比基准。
Matrix-Game 3.5 开源地址
https://github.com/Riemann-Dynamics/Matrix-Game-3.5
3
从Matrix-Zero 到 3.5:昆仑万维在全球世界模型赛道的持续深耕
昆仑万维是全球世界模型赛道中起步最早、系统化程度最高的企业之一。从Matrix-Zero到Matrix-Game 3.5,昆仑万维构建了一条完整的技术演进路径:
2025年5月
:正式开源Matrix-Game,成为工业界首个开源的10B+空间智能大模型;
2025年8月
:举办技术发布周,五天连发五款模型,Matrix-Game 2.0成为国内唯一对标谷歌Genie的开源模型;
2026年3月
:中关村论坛发布Matrix-Game 3.0,首次系统性地将记忆问题纳入开源解决方案;
2026年6月 :
智源大会上公布Matrix-Game 3.5预览版,展示最新技术突破;
2026年7月
:Matrix-Game 3.5正式发布,从游戏载体走向通用世界模型。
4
世界模型的下一程
从行业发展节奏看,交互式世界模型正在经历几个关键跃迁:从只能生成视频到能够生成可交互环境,从离线生成走向实时交互,从无记忆的短片段走向具备分钟级一致性的长时序生成,从单一研究模型走向面向开发者和用户的产品化平台。Genie系列从Genie-1到Genie-3的迭代、Marble在2025年底完成的商业化尝试,以及2026年初开始出现的产品化探索,都指向同一个方向:世界模型正在从实验室走向真实的产业应用,
并且已经从纯学术命题演进为机器人、仿真、游戏与通用AI底层能力的竞争
。
昆仑万维Matrix团队全力推进从3.0到3.5的升级迭代,核心目标在于攻克世界模型长时序生成中的记忆瓶颈。随着Matrix-Game 3.5的开源与发布,世界模型正在从“视觉逼真”迈向“真正理解物理世界”。
未来三到五年,世界模型会成为游戏行业的基础设施,内容生产的方式会被彻底刷新。
方汉在论坛上判断2026年是世界模型元年,某种程度上正是基于这样的行业观察——当实时性、记忆能力、数据规模化这几个此前制约世界模型走向应用的瓶颈逐一被打通,世界模型作为AI游戏、具身智能等下游场景底层能力的价值才真正开始显现。昆仑万维旗下Skywork AI在这条路径上的持续投入,也让Matrix-Game从最早的可交互世界模型验证,逐步走到了如今5B参数、720P、单卡实时、分钟级记忆的阶段。
在这条道路上,我们将持续深耕,步履不停。




相关文章
- 检疫区最后一站结膜炎与红眼区别一览 07-21
- 超大杯研究员的异常求汁欲第二章流程及单词出处 07-21
- 斗罗大陆诛邪传说什么时候上线 07-21
- 原神八重神子选精通沙还是攻击沙好 07-21
- 我不是盐神网站入口在哪 07-21
- 冒险者旅馆2全流程通关攻略是什么 07-21