您的位置:首页 > 手游攻略 > 对话昆仑万维方汉:世界模型“成本逻辑”之下,异构数据成为具身智能的解药

对话昆仑万维方汉:世界模型“成本逻辑”之下,异构数据成为具身智能的解药

作者:互联网  时间: 2026-07-29 08:02:57  

文本大模型逐渐收敛,世界模型也趋向统一采用DiT架构,技术底层逻辑因此愈发清晰。企业真正的竞争壁垒,正转向异构数据清洗能力、算法迭代效率,以及直接的资金和硬件筹措实力。

昆仑万维董事长兼CEO方汉

过去两年,人工智能行业的绝对主角是大语言模型(LLM);到了今年,舞台中心无疑转向形态多样的具身智能机器人和空间智能设备。

WAIC 2026展区内,具身智能成为围观层次最多、讨论最集中的赛道。无论技术极客还是产业资本,都在追问同一个问题:具身智能的“ChatGPT时刻”到底会在什么时候到来?

围绕下一代计算范式和人工智能物理形态展开的竞赛中,底层路线正以前所未有的速度经历分化与收敛。

“2026年是‘世界模型元年’,它标志着AI从生成内容转向理解物理世界并与之交互的关键节点。”昆仑万维董事长兼CEO方汉在“世界模型与多模态范式跃迁”专场论坛中作出这一判断。

论坛结束后,我们与方汉展开对话,话题从世界模型的端到端演进、Scaling Law在视频及物理世界中的延续,一直谈到一笔高达数百亿的“数据经济账”,由此勾勒出一幅较为清晰的产业路线图。

被问及行业真正会在何时出现分化时,方汉回到最本质的技术信条:数据量级。百万小时、千万小时、上亿小时,构成了一个等级清晰的坐标系。

随着文本大模型走向收敛、世界模型统一到DiT架构,底层技术逻辑日益透明。决定企业壁垒的因素,已经变为异构数据清洗能力、算法迭代速度,以及最直接的资金和硬件筹措能力。

站在2026年世界模型元年的风口,具身智能的观念已从技术黑盒转向工程流水线 。不过,这场重新定义物理世界交互规则的战役才刚开始。

这次对话可以归纳为以下五个核心观点。

一、路线走向统一:端到端世界模型与“千万小时”定律

当前具身智能仍处在早期探索期,虽然路线百花齐放,却多少像在迷雾中前进。方汉认为,可以选择一个参照坐标——自动驾驶。

“方汉认为,自动驾驶可以作为参照。经过多种技术路线的竞争后,自动驾驶最终全部收敛至端到端FSD系统,这是众所周知的过程。”方汉这样表示。

他进一步强调,具身智能和世界模型最终也一定会采用端到端架构,因为只有这种架构才可能真正实现“Scaling Up(规模扩展)”。

此前,各流派面对长尾场景和泛化性问题时都显得力不从心。端到端模型若要突破,核心在于跨过数据规模的“奇点时刻”。方总以视频生成模型作类比:视频模型经历多年沉寂,直到训练规模达到“20亿个15秒的切片”,才真正实现质量层面的飞跃。

目前进展到了哪一步?方汉透露,头部厂商普遍处于10万到20万小时阶段,行业因此正在争夺百万小时和千万小时关口。他预计,今年底或有厂商达到百万小时量级,头部厂商则极可能在明年底率先跨越千万小时拐点。

二、异构数据打开局面:一场从500亿到1亿元的“算账革命”

如果Scaling Law确实是不容置疑的规律,所有企业面前唯一共同的挑战就是——算账。面对千万小时乃至亿级小时的数据需求,现有具身智能数据采集模式似乎已经无法在商业逻辑上成立。

方汉列出了一笔相当残酷的账:早期具身智能数据主要包括UMI数据与真机数据,而这两类数据的生产成本非常高。

最基础的数据采集设备,过去仅单副采集手套就要十几万元,直到今年价格才勉强降到一万多元。即使有了设备,每小时UMI和真机数据的最低采集成本仍需500元rmb,较高时甚至达到一两千元。

“以1000万小时真机数据计算,按照500元单价,至少要投入50亿元;如果数据规模扩大到1亿小时,费用便是500亿元,任何企业都难以承受。”方汉坦率地说。

最终被确认能够打破这一资本黑洞的工具,是异构数据(HeterogeneousData)。

“异构数据可以来自手机,甚至胸挂摄像头拍摄的人手操作记录,它的出现让采购成本显著降低。”方汉介绍,目前异构数据采集成本已降到每小时50元左右;他还预测,从今年至明年,视频采集的异构数据成本有望进一步降至每小时10元。

“成本若降至10元一小时,生产1000万小时数据只需1亿元rmb,这一投入是大家可以承受的。因此,用异构数据来Scaling具身模型或世界模型,必然会成为最现实的路线。”方汉说道。

异构数据不仅拥有明显的成本优势,在生态多样性和复杂环境覆盖方面也远胜昂贵的真机数据。例如,黎曼动力机器人训练1.0模型时发现,引入大量异构数据不仅增强了泛化能力,甚至在“叠衣服”这种过去被认为仅需UMI数据的具体任务上,也产生了显著提升。

三、供应链与人口结构:中国难以复制的具身智能优势

方汉认为,在具身智能和世界模型赛道上,宏观战略优势正在向中国倾斜,其根基是中国完整且难以复制的工业门类,以及庞大人口基数。

具身数据本质上记录的是物理世界中的操作,因此无论采集何种数据,都高度依赖硬件设备与真实场景相结合。“中国是各类数据采集设备的主要硬件产地;若在硬件成本上与中国厂商竞争,全球没有谁能够胜过。”方汉直言不讳。

如同汽车雷达行业曾经历成本雪崩,具身视频采集设备如今也在走过相似路径。大量消费电子大厂已经入场,着手开发低成本、带运动加速度传感器的双目摄像头,以及隐蔽性更强、携带更方便的采集穿戴设备。

更深一层的护城河是“场景产能”。

“中国拥有全球最齐全的工业门类,意味着工业产品种类最完整;同时,发达的服务业又让我们能够构建极为丰富的各类操作数据。”方汉判断,最大的具身数据产能地必然是中国,因为中国既具备硬件制造能力,也能深入大量真实场景。

四、基础模型的护城河与“拿着钉子找锤子”的应用误区

讨论大模型商业化时,业内常有观点认为底层模型格局已经确定,下一阶段的重点将全面从模型层转向应用层和垂直行业。方汉对此并不赞同。

“他不太认可这一判断:应用层同样十分危险,因为没人知道某项应用能力会在什么时候被大模型的发展吸收并内化。”

他以近期热门的Skills(技能树)举例:最新一批文本大模型使用各行业专家编写的Skills进行训练,使大模型厂商可以轻易掌握这些行业最具价值的流程和能力。

针对大量创业者试图进入垂直行业的现状,方汉还指出一种产品定义上的逻辑错误——“拿着锤子找钉子”。许多创业者先认定自身模型能力很强,再四处寻找可赋能的行业,这种路径风险重重。

正确方式应该从结果反推:“先深入掌握某个行业最真实的需求,再从需求倒推,寻找能够满足它的模型或AI应用。”

五、泛娱乐的降维冲击:从短剧平权走向游戏模型的算力困局

方汉披露了一项商业事实:“今年API消耗量最大的品类必然是视频生成。国内某大厂的视频生成业务收入,已经超过其总收入的一半。”

门槛降低让创作者规模呈指数级增长,这正是此次爆发背后的逻辑。“视频模型爆款也许达不到当年电视剧《渴望》万人空巷的程度,但它承接了海量长尾需求,因此视频创作者数量绝不会少于网文作者。”

但在影视和游戏这两种备受期待的终极娱乐形态中,商业规律与物理法则使AI渗透速度出现了分化。

方汉认为,技术对AI电影而言早已不再构成障碍,爆款AI院线电影和长剧的问世只是时间问题。原生AI游戏则不同:游戏世界模型的推理速度必须超过传统3D引擎,而巨大的推理成本鸿沟使其落地至少还需3到5年。(本文最初发表于钛媒体APP,作者|李程程,编辑|杨林)

最新游戏

更多

Copyright©2010-2019. All rights reserved | 波波三国游戏官网|[email protected]

备案编号:湘ICP备2022015115号-4