板块 3 / 10

World Model 101:核心概念

这一页是全站总纲。读完你应该能:用 3 分钟向外行讲清世界模型;说清它与 LLM、视频生成的关系;画出四条技术路线并给出自己的判断。

本页目录
  1. 世界模型是什么:一句话 + 三个直觉 + 正式定义
  2. 它要解决什么问题
  3. 与 LLM 的关系:预测「下一个 token」vs 预测「下一个状态」
  4. 与视频生成的关系:Sora 是世界模拟器吗?
  5. 四大技术路线之争(2026 年视角)
  6. 关键时间线 2018–2026

1世界模型是什么

一句话定义

世界模型(World Model)是一个在 AI 内部构建的、对世界如何运作的可计算模拟——它能在「脑内」预测:如果我(或某个主体)做了某个动作,世界接下来会变成什么样。

三个直觉

正式一点的定义(两个源头)

💡 PM 视角:一句能对外讲的话
「LLM 教会了 AI 读写,世界模型要教会 AI 看见、想象、行动。」(这句化用了 World Labs「LLM 让机器学会处理文字,下一步是让 AI 理解空间」的公开表述。)面试时先给这句,再展开技术细节。

2它要解决什么问题

世界模型的价值 = 同时解决三个「贵」的问题:

  1. 数据太贵(仿真价值):机器人/自动驾驶最需要的长尾、危险、事故场景,现实中天然稀疏、采集昂贵且危险。世界模型可以「制造所需数据」而非「抓取已有数据」——生成新轨迹、新视角、新交互作为训练素材。2026 年行业已把世界模型明确定位为物理 AI 的「数据工厂」(NVIDIA Cosmos、Wayve GAIA、特斯拉/Waymo 的驾驶世界模型均属此类)。
  2. 试错太贵(规划价值):真实机器人摔一次几十万元。有了世界模型,智能体可以在「想象」中预演动作后果再行动——V-JEPA 2 只用 62 小时机器人数据就实现新环境零样本抓取规划(Meta,2025-06);Dreamer 系列在潜空间「做梦」训练,DreamerV4 甚至仅靠离线视频(不与真实环境交互)就在 Minecraft 中挖到钻石(2025 末发布,细节待核实)。
  3. 创作太贵(内容价值):影视/游戏/广告里,实景拍摄、3D 建模、引擎搭建都是重成本。生成式世界模型把「造一个世界」的成本从人年级压到分钟级——Marble 用文本/图片生成可导出 3DGS/Mesh 的持久 3D 世界;Genie 3 实时生成可探索的交互环境;HY-World 2.0 生成的世界可直接对接 Unity/UE。
💡 PM 视角
这三类价值对应三类买家:数据工厂卖给做自动驾驶/机器人的公司(B 端);规划能力是机器人公司自研(战略投入);内容生成卖给创作者与企业(C 端订阅 + B 端 API)。你面的岗位偏第三类,但面试时展示你理解全部三类,格局立刻不同。

3与 LLM 的关系

LLM(大语言模型)World Model(世界模型)
预测什么下一个 token(文字)下一个状态(画面/表征/3D 场景)
训练数据互联网文本视频、图像、传感器流、机器人轨迹、3D 数据
知识类型人类沉淀的陈述性知识(「知道 that」)物理世界的程序性/因果知识(「知道 how」)
与行动的关系输出文字,不直接作用于物理世界动作条件化:给定动作预测后果,可直接支撑规划与控制
代表GPT、Claude、Gemini 文本侧Genie 3、Cosmos、Marble/Atlas、V-JEPA 2、Dreamer

LeCun 的「死胡同」论(必须知道的行业争论)

Yann LeCun 长期主张:自回归 LLM 是通往高级机器智能的死胡同——逐 token 预测缺乏对物理世界的因果理解、没有持久记忆、无法规划。他认为出路是世界模型 + JEPA:在压缩的抽象表征空间预测未来,而不是生成像素。2025-11 他宣布离开 Meta,2025-12 创立 AMI Labs(Advanced Machine Intelligence),2026-01 在巴黎启动,两个月融资超 10 亿美元,CEO 为 Alexandre LeBrun,LeCun 任执行主席;2026-07 团队发布可在部署中持续学习的 AdaJEPA。这标志着「世界模型 vs LLM」从学术争论变成真金白银的路线创业。

但也有人走「融合」路线

并非所有世界模型都反 LLM。DeepMind 的 Genie 3 建立在 Veo 视频生成模型之上;NVIDIA Cosmos 3(2026-06)用 Mixture-of-Transformers 把语言、图像、视频、音频、动作统一进一个全模态模型,可当 VLM 推理、也可当世界模拟器;World Labs Atlas 也是原生处理文本/图像/视频/3D 的 omni model。「LLM 与世界模型是对立还是互补」本身就是 2026 年最好的面试讨论题——建议你的立场:短期互补(LLM 做理解与接口,世界模型做预测与仿真),长期看具身数据规模决定谁吸收谁。

4与视频生成的关系:Sora 是世界模拟器吗?

这是世界模型领域最著名的一场争论,你必须能讲清楚:

💡 PM 视角:这段争论的产品转译
视频生成模型是「只读的世界模型」——你能看它推演世界,但不能插手;交互式世界模型(Genie 3、Oasis)是「可读写的世界模型」——你的动作实时改变世界。从「可看」到「可玩」到「可用于训练机器人」,是能力与商业价值的三级跳。JD 里「打破 GUI 的新型交互」指的就是第二级,「自动驾驶/具身仿真」指的是第三级。

5四大技术路线之争(2026 年视角)

业内对「怎么造世界模型」尚无共识,主流可分四条路线(不同来源划分略有差异,此处取最通用的四分法):

路线核心思想代表优势短板
① 视频生成派
(扩散/DiT)
把世界当连续视频流,用扩散模型在像素/潜空间直接生成未来画面Sora(已关停)、Veo 3.1、Seedance 2.x、可灵 3.0、Cosmos-Predict、HunyuanVideo 1.5画面真实度最高;直接可卖(内容创作);数据管线成熟物理刚性弱(碰撞形变)、长时序一致性难、生成慢、算力贵
② 自回归交互派
(帧级实时生成)
像语言模型逐 token 一样「逐帧」生成世界,动作作为输入条件,实时可交互Genie 1/2/3、Decart Oasis/Mirage、GameNGen(神经网络实时生成 DOOM)、DIAMOND真正的「可玩」世界;交互延迟低(Genie 3 达 24fps)记忆短(分钟级)、分辨率与画质受限、内容易漂移
③ 3D 空间派
(显式几何重建)
先构建持久化 3D 表示(3DGS/Mesh/点云),再在其中渲染、编辑、漫游World Labs Marble/Atlas、腾讯 HY-World 2.0、NeRF/3DGS 学术生态世界稳定持久、可导出进引擎(Unity/UE)、多视角天然一致动态物体与物理交互仍是弱项;生成范围有限
④ 潜空间表征派
(JEPA/隐式预测)
不生成像素,在压缩的抽象表征空间预测未来状态,效率优先LeCun 的 JEPA/V-JEPA 2、AMI Labs、Dreamer 家族样本效率极高(62 小时机器人数据零样本规划);接近人类认知方式;适合控制与规划不产生可看的画面(内容价值低);离 C 端产品最远

另有综述提出「具身控制派」(以动作执行为中心)等更细划分;四条路线正在融合:Cosmos 3 与 Atlas 都是「全模态」架构,Genie 3 建立在视频模型上但强调交互,HY-World 把视频生成与 3D 重建打通。

💡 PM 视角:路线 = 市场
记住这个对应关系,面试讨论「你怎么看路线之争」时直接用:①视频派 → 内容创作市场(今天就有钱);②交互派 → 游戏/UGC 市场(明天的平台);③3D 派 → XR/影视资产/数字孪生市场(B 端工作流);④潜空间派 → 机器人/自动驾驶市场(战略纵深)。没有唯一赢家,赢家取决于你在哪个市场。你面的岗位在 ①③ 的交汇处(内容生成 + 多视角 + XR)。

6关键时间线 2018–2026

← 上一章
岗位解码
下一章 →
技术主线:从 Transformer 到 Genie 3