最新下载
热门教程
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
对话昆仑万维方汉:世界模型“成本逻辑”之下,异构数据成为具身智能解药
时间:2026-07-29 12:00:51 编辑:袖梨 来源:一聚教程网
随着文本大模型逐步收敛、世界模型统一到DiT架构,底层技术逻辑愈发清晰。企业真正的壁垒已转向异构数据清洗能力、算法迭代速度,以及最直接的资金和硬件筹措能力。

昆仑万维董事长兼CEO方汉
过去两年,人工智能行业的绝对主角是大语言模型(LLM);到了今年,各种形态的具身智能机器人与空间智能设备无疑站到了舞台中央。
WAIC 2026展区里,具身智能成为围观层层叠叠、讨论最密集的赛道。无论技术极客还是产业资本,都提出同一个疑问:具身智能的“ChatGPT时刻”到底会在何时出现?
围绕下一代计算范式和人工智能物理形态的竞争中,底层路线正在以空前速度发生分化与收敛。
“2026年将成为‘世界模型元年’,这标志着AI从生成内容转向理解物理世界并与其交互的关键节点。”昆仑万维董事长兼CEO方汉在“世界模型与多模态范式跃迁”专场论坛中作出这一判断。
论坛结束后,我们与方汉展开对话,议题从世界模型的端到端演进、Scaling Law向视频和物理世界的延伸,一直谈到高达数百亿的“数据经济账”,由此呈现出一幅较为清晰的产业路线图。
被问及行业真正的分化节点何时出现,方汉回到最本质的技术信条:数据量级。百万小时、千万小时、上亿小时,构成一个层级鲜明的坐标系。
文本大模型日益收敛,世界模型也统一到DiT架构,技术底层逻辑随之透明。真正的企业壁垒已转移至异构数据清洗能力、算法迭代速度,以及最直接的资金与硬件筹措能力。
站在2026年世界模型元年的风口,具身智能已经从技术黑盒的思维转向工程流水线。至于这场重构物理世界交互规则的战役,如今才刚开始。
以下归纳本次对话的五项核心观点。
一、路线走向统一:端到端世界模型与“千万小时”定律
具身智能目前仍处于早期探索阶段,路线百花齐放,却也如同在迷雾中前行。方汉认为,可以选取一个坐标系作为对照:——自动驾驶。
“我认为自动驾驶可以作为参照。众所周知,自动驾驶在多条技术路线竞争后,最终都收敛到端到端的FSD系统。”方汉如此表示。
他强调,世界模型与具身智能最终必然采用端到端架构,因为唯有这种架构才能在真正意义上实现“Scaling Up(规模扩展)”。
此前,各流派在处理长尾场景和泛化性时往往力不从心;端到端模型要实现突破,关键是跨过数据规模的“奇点时刻”。方总以视频生成模型作类比:视频模型沉寂了多年,直至训练规模达到“20亿个15秒的切片”,才真正产生质的跨越。
当前进展到了哪一步?方汉透露,头部厂商普遍处于10万到20万小时阶段,行业正竞相冲击百万小时和千万小时门槛。他预计,今年底或有厂商达到百万小时,而头部厂商极可能在明年底率先突破千万小时拐点。
二、异构数据打开局面:从500亿到1亿元的“成本革命”
若Scaling Law是无需怀疑的规律,那么所有企业面前只剩下一个挑战:——算账。面对千万小时乃至亿级小时的数据需求,具身智能原有的数据采集模式在商业逻辑上几乎难以成立。
方汉算出一笔颇为残酷的账:早期具身智能数据主要由UMI数据和真机数据构成,而这类数据的生产成本非常高。
以基础数据采集设备为例,单副采集手套原先要十几万元,直到今年才勉强降到一万多元。即便有了设备,每小时UMI和真机数据的最低采集成本仍需500元rmb,高时甚至达到一两千元。
“可以简单计算:生产1000万小时真机数据,按每小时500元计,至少要50亿元;若数据规模达到1亿小时,成本就是500亿元,任何企业都难以承受。”方汉坦率地说。
最终被确认能够打破这一资本黑洞的工具,是异构数据(HeterogeneousData)。
“异构数据可以来自手机,甚至胸挂摄像头拍摄的人手操作过程,它的出现让采购成本显著降低。”方汉表示,异构数据当前采集成本已降至每小时50元左右;他进一步预计,从今年到明年,视频采集的异构数据成本有望下降至每小时10元。
“每小时成本若降至10元,1000万小时数据只需1亿元rmb,大家能够承担。因此,用异构数据来Scaling具身模型或世界模型,必然是最现实的路线。”方汉表示。
异构数据除拥有绝对成本优势外,对生态多样性与复杂环境的覆盖也远超昂贵的真机数据。例如黎曼动力机器人训练1.0模型时发现,大量引入异构数据不仅增强了泛化能力,甚至对“叠衣服”这类过去被认为只需UMI数据的具体操作,也产生了显著提升。
三、供应链和人口结构:中国难以复制的具身智能优势
在具身智能和世界模型赛道上,方汉认为宏观战略天平正在倒向中国,其基础是中国难以复制的完整工业门类和庞大人口规模。
具身数据本质上记录的是物理世界操作,因此任何数据采集都高度依赖硬件设备与真实场景相结合。“中国是各类数据采集设备的主要硬件产地;若与中国厂商竞争硬件成本,全球没有对手能够胜出。”方汉直言不讳。
如同汽车雷达行业曾经历的成本骤降,具身视频采集设备也在重走相似道路。众多消费电子大厂已经进入,研发低成本、配备运动加速度传感器的双目摄像头,以及更隐蔽、更便携的穿戴采集设备。
更深一层的护城河是“场景产能”。
“中国具备全球最完整的工业门类,也就拥有最齐全的工业产品;同时服务业高度发达,因此能够构造极其丰富的各类操作数据。”方汉判断,最大的数据库产地必定是既拥有硬件制造能力,又可以深入具体场景的中国。
四、基础模型的护城河及“拿着钉子找锤子”这一应用陷阱
讨论大模型商业化时,行业常有观点认为底层模型格局已定,未来重心会从模型层全面转向应用层和垂直领域,方汉对此并不赞同。
“我不太赞同这种观点。应用层同样非常危险,因为谁也不知道应用能力何时会被大模型的发展吸收并内化。”
他以近期热门的Skills(技能树)为例指出,最新一批文本大模型使用各行业专家编写的Skills训练,使大模型厂商可以轻易掌握这些行业最有价值的流程与能力。
针对大量创业者尝试进入垂直行业的现状,方汉还指出其产品定义存在一种逻辑错误:——“拿着锤子找钉子”。不少创业者自认为模型能力强,便四处寻找行业进行赋能,这种路径风险重重。
正确做法应从结果反推:“首先要深入了解一个行业的真实需求,再从需求向后推导,寻找能够满足它的模型或AI应用。”
五、泛娱乐的降维冲击:从短剧平权到游戏模型算力困局
方汉披露了一项商业现实:“今年消耗量最大的API必然来自视频生成。国内某大厂的视频生成收入,已经超过其总收入的一半。”
这一爆发的内在逻辑,是门槛降低推动创作者规模呈指数级增长。“视频模型的热门作品或许达不到当年电视剧《渴望》万人空巷的程度,但满足了大量长尾需求,视频创作者人数绝不会少于网文作者。”
不过在影视、游戏这两种备受期待的终极娱乐形态中,AI渗透速度受到商业规律与物理法则影响,已经出现分化。
方汉认为,AI电影在技术上早无障碍,出现爆款AI院线电影与长剧只是时间问题;但原生AI游戏受巨大推理成本差距制约(游戏世界模型推理速度须超过传统3D引擎),真正落地至少还要3到5年。(本文最初发布于钛媒体APP,作者|李程程,编辑|杨林)
相关文章
- 洛克王国世界海盔虫家族生态详解 07-29
- 幻兽帕鲁铬矿石高效挖取点位一览 07-29
- 《龙之剑:觉醒》实用配队思路及配装推荐 07-29
- Xbox高管说明服务中断原因,承诺“会做得更好” 07-29
- 《魔兽世界》TBC周年大更:双经典团本重返!S3开启 07-29
- 明日方舟终末地弧光赫铜装备推荐 07-29