近日,斯坦福大学教授、AI 视觉领域权威学者、World Labs 创始人李飞飞携团队发布万字重磅学术长文《A Functional Taxonomy of World Models》,文章迅速刷屏创投圈、人工智能产业与科研平台,直指当下火爆出圈的 Sora、可灵等文生视频产品本质是视觉渲染,仅停留在像素 “画皮” 层面,以物理模拟器为核心的空间智能、通用世界模型,才是人工智能下一轮万亿级产业风口。
当前全球 AI 产业扎堆布局文生视频,各类产品凭借电影级写实画面引爆市场热度,大量厂商冠以 “世界模型” 概念募资落地。李飞飞在文中一针见血指出,“世界模型已是 AI 行业被滥用最严重的专业名词”,依托 POMDP 强化学习经典框架,首次将市面五花八门的 AI 产品划分为渲染器、模拟器、规划器三大类别,厘清行业长期概念乱象。
其一为渲染器,也就是市场大热的文生视频、文生图像模型。该类产品主打像素画面逼真,依靠海量图像数据拟合视觉效果,但无法理解三维空间结构、物体物理规则与客观因果逻辑,时常出现物体穿模、空间扭曲等漏洞,只可输出供人类观赏的画面,没有落地实体产业的底层能力,看似火爆实则局限于内容娱乐,产业天花板清晰,是依附视觉效果的表层技术。
其二是被资本和行业严重低估的物理模拟器,也是李飞飞重点看好的万亿赛道核心。模拟器不追求画面美观,聚焦还原现实世界几何、力学、光影等客观物理规律,输出可计算、可交互的真实世界状态,可深度落地自动驾驶仿真、工业机器人调试、智能制造数字孪生、医疗仿生模拟、全域虚拟实训等硬核场景,横跨制造、汽车、医疗、基建、机器人多领域,是打通虚拟与现实的关键底座。
第三类规划器面向具身智能,依托环境数据输出智能体行动决策,支撑人形机器人、服务机器人自主作业,是通用机器人产业化的关键支撑。李飞飞预判,未来三大技术将逐步打破技术壁垒走向融合,最终形成大一统通用世界基础模型,实现既能写实渲染画面、又能精准模拟物理、自主规划动作的完整空间智能体系。
长文进一步点明,大语言模型、文生视频本质是让 AI “谈论世界”,而空间智能、物理模拟器是让 AI “理解并改造真实世界”。语言是人类后天创造的符号,但客观世界依托空间与物理规律运转,仅靠文本与像素生成的 AI 存在天然能力上限;空间智能落地后,将重构机器人、工业仿真、元宇宙基建、自动驾驶测试等万亿体量市场,是继大模型之后 AI 产业确定性最高的成长赛道。
业内创投机构、头部科技企业第一时间解读文章观点,多家券商研报同步更新赛道研判:短期文生视频仍将持续内容商业化红利,但中长期产业重心、资本流向将全面转向物理模拟与空间智能研发,全球新一轮 AI 产业投资逻辑迎来重构。李飞飞团队旗下 World Labs 也正围绕模拟器与空间智能落地技术研发,加速推进技术商业化落地验证。