板块 4 / 10

技术主线:PM 需要懂到什么深度

每个概念四段式:一句话定义 / 直觉解释 / 为什么重要 / 关键参考。目标是「能跟研究员对话、能做产品判断」,不推公式。

本页目录
  1. 生成式基础:Transformer · Diffusion · Autoregressive · 多模态
  2. 视频生成:Sora · Veo · Runway · Luma · 可灵 · Seedance · 混元 · 海螺 · Pika
  3. 3D 表示:NeRF · 3D Gaussian Splatting · 隐式/显式 · 前馈式 3D 生成
  4. 世界模型:World Models · Dreamer · Genie · 神经游戏引擎 · JEPA · 具身/仿真
  5. 交互范式:从 prompt 到打破 GUI

1生成式基础

Transformer P0

一句话定义
2017 年《Attention Is All You Need》提出的神经网络架构,用「注意力机制」让模型并行处理序列中任意位置的关系,是 LLM、DiT、几乎所有现代生成模型的公共骨架。
直觉解释
注意力 = 「处理每个元素时,动态决定看其他哪些元素、看多重」。写「它」字时,模型自动把注意力放向前文的「小猫」。视频生成里同理:生成某一帧的某块区域时,注意力会跨越时间与空间去看其他帧、其他区域——这就是「一致性」的技术来源。
为什么重要
Sora 的 DiT、可灵的 MVL+DiT、Cosmos 3 的 Mixture-of-Transformers 全是 Transformer 变体。跟研究员对话时,「scaling law(规模定律)」「注意力成本随分辨率/时长平方增长」是两个必备谈资——后者直接解释了为什么长视频又贵又难。
关键参考
原始论文 arXiv:1706.03762 · Jay Alammar 图解 Transformer(最佳入门)

Diffusion 扩散模型(DDPM / Latent Diffusion)P0

一句话定义
训练模型「从纯噪声一步步去噪还原出图像/视频」的生成范式(DDPM, 2020);Latent Diffusion(2021,Stable Diffusion 基础)先用 VAE 把图像压缩到低维潜空间再去噪,大幅降低算力。
直觉解释
雕塑家从一块大理石(噪声)里逐步凿出雕像(图像)。训练时学会「任意一步该怎么凿」,生成时就从随机噪声开始凿几十步。潜空间扩散 = 先在「草图」上凿,凿完再放大成高清——这就是为什么现代视频模型都带 VAE。
为什么重要
当今视频生成的绝对主流:Sora/Veo/可灵/Seedance/HunyuanVideo/Cosmos-Predict 全是扩散系(多数是 DiT=扩散+Transformer)。产品含义:①生成需要多步去噪 → 慢、贵,蒸馏少步化是降本主线;②从噪声出发 → 每次结果不同,这就是「抽卡」的根源,也是「可控性」成为产品竞争焦点的技术原因。
关键参考
DDPM arXiv:2006.11239 · Latent Diffusion arXiv:2112.10752 · Lilian Weng 博客(深入但可读)

Autoregressive 自回归生成 P0

一句话定义
「根据前文预测下一个元素」的生成方式:LLM 逐 token 生成,视频世界模型可逐帧生成(上一帧+动作 → 下一帧)。
直觉解释
接龙游戏:每次只写下一个字,写出的字又成为下一次的输入。交互式世界模型(Genie 3、Oasis)就是「画面接龙」——玩家按键 = 给接龙加一个条件。
为什么重要
两条含义:①它是「实时交互」的技术前提(扩散一次性生成整段视频,自回归天然支持边玩边生成);②它是 LeCun 批判的靶子——逐 token 误差累积、缺乏全局规划。面试聊到「为什么交互世界模型难做长时序一致性」,答案就是自回归的误差漂移。
关键参考
Genie 论文(自回归+潜动作的世界模型范例)arXiv:2402.15391

多模态 Multimodal P1

一句话定义
让模型同时理解/生成多种数据类型(文本、图像、视频、音频、3D、动作);技术底座是 CLIP 式对齐与 ViT 式视觉编码。
直觉解释
给不同模态发「统一 passports」:文字、图片、声音都被翻译成同一个语义空间里的向量,于是「一只橘猫」的文本向量和橘猫照片向量彼此靠近——文生图的原理即「用文字向量当导航,指挥扩散模型往猫的方向去噪」。
为什么重要
2025–2026 的产品竞争焦点已经从单模态质量转向多模态组合:Seedance 2.0 允许 9 图+3 视频+3 音频+文本混合输入;Veo 3 起原生音画同步生成;Cosmos 3/Atlas 干脆是「全模态」。你的 Agent 路由经验在这里直接复用:多模态输入本质上是个「意图理解+分发」问题。
关键参考
CLIP arXiv:2103.00020 · ViT arXiv:2010.11929

加餐:Flow Matching 与 DiT P2

一句话定义
Flow Matching 是扩散的简化/加速训练与采样框架(学习从噪声到数据的「直线流场」);DiT(Diffusion Transformer, 2022)是把扩散模型骨架从 U-Net 换成 Transformer 的架构,被 Sora 采用后成为视频生成标配。
为什么重要
读论文摘要高频出现:GAIA-2「flow matching 训练」、Cosmos-Predict2.5「flow-based」、可灵「DiT」。能认出这两个词 = 论文摘要阅读无障碍。
关键参考
DiT arXiv:2212.09748

2视频生成(JD 点名领域,最重投入)

💡 先记一条行业主线(2024→2026)
能力竞赛:时长 5s→10s→30s+;分辨率 720p→1080p→2K/4K;模态 无声→原生音画同步→四模态输入;产品重心从「文生视频抽卡」转向「多素材参考 + 局部编辑 + 工作流」。格局变化:Sora 从震撼发布到 2026-04 关停;中国厂商(可灵/Seedance/混元/海螺)在可用性与商业化上反超。下面按「必懂的技术概念 → 各家产品」展开。

Sora 与时空 patch(Spacetime Patches)P0

一句话定义
OpenAI 的视频生成模型(2024-02 预览、2025-09-30 发布 Sora 2、2026-03 宣布关停);其核心技术是把视频切成「时空 patch」(小方块×短时间片的三维小块)作为 Transformer 的统一 token,从而支持任意分辨率/时长/宽高比。
直觉解释
把电影胶片剪成小方块再打乱,让模型学会「根据周围方块猜中间方块」——与分辨率无关,所以 Sora 能生成横屏竖屏任意尺寸。这套思路源自 DiT 论文的 patch 化 + ViT。
为什么重要
①「video generation models as world simulators」命题的出处,世界模型争论的原点;②Sora 2 的物理准确性(篮球打铁正确反弹)与同步音频曾代表行业天花板;③它的关停是 PM 必读案例:技术领先 ≠ 产品成功(成本、留存、可用率、版权诉讼、迪士尼合作告吹等多重因素,部分细节待核实)。面试聊 Sora,重点应放在「兴衰复盘」而非「参数崇拜」。
关键参考
Sora 技术报告(2024-02) · Sora 2 发布页(含关停公告)

Google Veo(3 / 3.1)与 Gemini Omni Flash P1

一句话定义
Google DeepMind 的视频生成线:Veo 3(2025-05,首个原生同步音频生成的旗舰视频模型)、Veo 3.1(2025-10,支持场景扩展/首尾帧控制,API 约 $0.05–0.60/秒);2026 年 I/O 推出 Gemini Omni Flash——多模态输入(文/图/音/视频)+ 多轮对话式视频编辑的新主力,Veo 3.1 转为特定功能(扩展/收尾帧)使用。
直觉解释
Google 的打法是「全家桶」:Veo 负责高端影视级生成(Flow 创作工具、Google Vids 免费额度、Gemini App 入口),Genie 负责交互世界,两者同源(Genie 3 构建于 Veo 技术之上)。
为什么重要
「对话式编辑视频」(Omni Flash 的多轮修改:换元素、改视角)就是 JD 说的「打破 GUI 的交互」的落地形态之一;按秒计费的 API 定价是行业价格锚点。
关键参考
DeepMind Veo 官方页 · Gemini API 视频生成文档(Omni Flash + Veo 3.1)

Runway:Gen-3 Alpha → Gen-4 / 4.5 → Aleph P0

一句话定义
面向专业创作者的视频 AI 公司:Gen-3 Alpha(2024-06)确立第一梯队;Gen-4(2025-03)主打「world consistency」——角色面孔、道具、环境跨镜头保持一致;Aleph(2025-07)是「视频到视频」的指令式编辑模型(换场景、加特效、改元素);2026 年 Gen-4.5 居文生视频 Elo 榜首,Aleph 2.0 + Edit Studio(2026-05-21)把编辑做成了独立产品。
直觉解释
Runway 的产品哲学 = 「AI 时代的 Adobe」:不追求社交平台,死磕影视后期工作流——生成只是入口,编辑(Aleph/Edit Studio)才是留存与付费的关键。
为什么重要
①JD 点名 Gen-3,但你要知道它已演进两代;②「一致性」这个词的产品化定义基本是 Runway 带起来的;③它代表与 Sora 相反的成功路径:不做大而全的模拟器,做小而深的专业工具。对比 Sora 关停复盘,是面试绝佳素材。
关键参考
Aleph 2.0 & Edit Studio 发布(2026-05) · Runway General World Models 愿景文(2025-05,理解其世界观)

Luma Dream Machine 与 Ray 系列 P1

一句话定义
Luma AI(2021 年创立,以 NeRF 3D 捕捉起家)的 Dream Machine 平台(2024-06 上线)与 Ray 模型线:Ray2(2024-12,以运动质量与「逻辑事件序列」著称)、Ray3(2025-09,原生 HDR + 内置推理,可自我评估生成结果、支持画面上涂鸦控制镜头)、Ray3.14(2026-01,1080p、生成提速 4 倍成本降 3 倍)、Ray3.2(2026-06,16 关键帧控制 + 首个完整开发者 API)。
直觉解释
Luma 的独特基因:从 3D(NeRF)走向视频,所以一直强调「相机/镜头语言」的控制力——关键帧控制、涂鸦控镜头,都是给「导演型用户」的工具。
为什么重要
JD 点名 Dream Machine;Ray3 的「推理式生成」(模型先想再画、自我迭代)与「涂鸦交互」分别是技术趋势与交互趋势的代表案例。
关键参考
Dream Machine 官网 · Ray 系列介绍

快手可灵 Kling P0

一句话定义
快手的视频生成大模型(2024-06 上线),22 个月迭代 30+ 次:2.0(2025-04,Artificial Analysis 图生视频榜首)、2.1(性价比线)、3.0(2026-02,自研 MVL 多模态架构 + DiT,全模态输入输出,原生 4K/60fps/15s);商业化全球领先——2026 Q1 营收超 6.5 亿元、3 月 ARR 近 5 亿美元、Q2 营收 8.5 亿元(同比 +200%+)、6 月全球用户破 1 亿、企业客户近 5 万。
直觉解释
可灵的成功公式 = 「抢在 Sora 开放前做出可用产品」(负责人盖坤的决策)+ 快手短视频生态的真实创作者反馈 + 高频迭代。产品上还推出了「灵动画布 Agent」模式——生成式画布 + Agent 编排,与你的 canvas 经验直接同频。
为什么重要
中国团队在视频生成商业化的标杆;「运动控制派」技术路线代表;面试必备案例(尤其你来自字节,会被问「你怎么看可灵 vs 即梦」)。
关键参考
快手 2026 Q1 投资者材料(可灵数据一手来源) · 可灵 AI 官网

字节 Seed 视觉线:Seedance / Seedream / Seed3D 与即梦 P0

一句话定义
字节跳动 Seed 团队的生成模型矩阵:Seedance 1.0(2025-06)→ 2.0(2026-02,双分支 DiT、文/图/视频/音频四模态输入、端到端音画同步、60 秒多镜头叙事、官方称复杂场景可用率超 90%)→ 2.5(2026-07-31,单次 30 秒 + 高保真时序延长、最多 50 个多模态参考素材、视频局部编辑、10+ 语言);另有 Seedream(图像)、Seed3D 2.0(3D,2026-04)、SeedRealtime(音视频全双工,2026-08)。C 端出口为即梦/豆包/扣子,B 端走火山引擎。
直觉解释
字节的打法是「工业级创作」:不赌单点惊艳,赌可用率、可控性、多素材参考——让创作者像导演一样掌控角色/运镜/节奏,终结「抽奖式生成」。
为什么重要
你的「母队」产品线,面试必被深挖:要能讲清 Seedance 2.x 与可灵/Veo 的差异化、即梦与剪映/CapCut 的协同与张力、火山引擎 API 的 B 端打法。发布当日徐工/小鹏/灵初智能等企业宣布合作,显示其向具身/工业场景延伸。
关键参考
字节 Seed 官方博客(一手来源) · 即梦 AI

腾讯混元 HunyuanVideo / Hunyuan Image / Hunyuan3D P1

一句话定义
腾讯的开源生成矩阵:HunyuanVideo 13B(2024-12 开源,当时最大开源视频模型)、HunyuanVideo 1.5(2025-11-20 开源,8.3B + SSTA 注意力,14GB 显存消费级显卡可跑)、Hunyuan Image 3.0(2025-09,80B 原生多模态生图)、Hunyuan3D(开源 3D 生成事实领先者,10–25 秒生成游戏可用资产)。
直觉解释
腾讯的策略 = 「开源换生态」:模型免费商用,赚云服务与生态位的钱。1.5 版的「消费级显卡可跑」是对全行业的成本重击。
为什么重要
开源模型决定了行业成本地板与中小开发者生态,面试谈「API 生态/开发者生态」必引用;混元 3D 与世界模型(HY-World,见下节)打通了「视频生成 → 3D 世界」链路。
关键参考
HunyuanVideo GitHub · HunyuanVideo 1.5 技术报告 arXiv:2511.18870

MiniMax 海螺 Hailuo 与 Pika P2

一句话定义
海螺 Hailuo 02(MiniMax,2025-06,Noise-aware Compute Redistribution 架构,以物理运动真实感与低价著称;后续 2.3 版 2025-10;MiniMax 2026-01 港股上市)。Pika(2023 年斯坦福博士创立)以创意特效出圈(Pikaffects「捏爆/融化」等病毒玩法),Pika 2.5 为当前旗舰,并推出 Pika Agents(用「人」替代 prompt 框)与 PikaStream(实时 agent 视频)转型。
为什么重要
海螺代表「性价比+物理真实」差异化;Pika 代表「病毒营销+特效娱乐」差异化——两者说明第一梯队之外仍有生态位。快速了解即可。
关键参考
海螺官网 · Pika 官网

33D 表示(补 CV 短板的核心章)

NeRF 神经辐射场 P1

一句话定义
Neural Radiance Fields(ECCV 2020 最佳论文):用一个神经网络「记住」整个 3D 场景——输入任意 3D 坐标+观察方向,输出该点的颜色与密度;从几十张照片即可重建可自由换机位的逼真场景。
直觉解释
把场景「烘焙」进网络权重里:网络学的不是照片,而是「从这个角度看,这个世界长什么样」的函数。新视角合成(Novel View Synthesis)= 拿没拍过的机位去问这个函数。
为什么重要
「多视角一致性」的技术源头之一;Luma 正是靠 NeRF 3D 捕捉起家。缺点:训练慢(每场景数小时)、渲染慢,难进实时管线——这直接催生了 3DGS。
关键参考
NeRF 论文 arXiv:2003.08934 · NeRF 项目页(可视化极佳)

3D Gaussian Splatting(3DGS)P1

一句话定义
SIGGRAPH 2023 提出的显式 3D 表示:用几十万个带颜色/透明度/朝向的「3D 高斯椭球」直接摆出场景,光栅化实时渲染(100+ fps),质量不输 NeRF 而速度快几个数量级。
直觉解释
NeRF 是「把世界记在脑子里」(隐式),3DGS 是「用一堆彩色棉花糖把世界堆出来」(显式)。「Splatting」= 把这些椭球按视角拍扁(泼溅)到屏幕上合成图像。
为什么重要
2024–2026 的事实标准:Marble 导出 Gaussian splats;HY-World 2.0 生成 3DGS/Mesh 场景;Atlas 重建输出 3DGS;3DGS 已成为 3D Web/游戏引擎的一等公民(2026 年 UE 等引擎已有成熟插件,代价是绕过传统光照管线)。PM 判断点:3DGS 适合「视觉捕获与漫游」,Mesh 适合「编辑与物理交互」,两者将长期共存。
关键参考
3DGS 论文 arXiv:2308.04079 · 项目页

隐式 vs 显式表示 P2

一句话定义
显式表示 = 直接存几何(点云、Mesh 网格、体素、3DGS);隐式表示 = 用神经网络函数编码场景(NeRF、SDF 符号距离场)。
直觉解释
显式像「乐高模型」——看得见摸得着、可直接改;隐式像「配方」——要问函数才知道某点长什么样,难直接编辑但紧凑、连续、分辨率无关。
为什么重要
这是读一切 3D 论文/产品文档的分类学基础:看到 mesh/point cloud/voxel → 显式;看到 neural field/SDF/latent → 隐式。世界模型的「3D 空间派」本质是在隐式与显式之间找折中(如 Atlas:神经网络生成 + 显式 3DGS 输出)。
关键参考
HY-World 2.0 论文(多模态输入→3D 世界输出的工程范例)arXiv:2604.14268

前馈式 3D 生成(Feed-forward 3D Generation)P1

一句话定义
不再「每个场景单独优化几小时」(NeRF/3DGS 原始方式),而是训练一个大模型直接「一秒出 3D」:单图/文本 → 3D 资产或场景。代表:腾讯 Hunyuan3D 系列(10–25 秒出游戏可用资产,开源生态第一)、微软 TRELLIS、World Labs Marble/Atlas(场景级)、字节 Seed3D 2.0。
直觉解释
从「请雕塑家为你现场雕」变成「3D 打印机一键出货」——模型见过千万个 3D 物体,学会了从一张照片「脑补」完整三维结构(看不见的背面也补出来)。
为什么重要
这是「3D 内容生产瓶颈」的解法,直接决定 XR/游戏/电商 3D 的供给成本。PM 判断点:资产级(物体)已接近可用,场景级(可漫游世界)刚起步(Marble/HY-World 2.0/Atlas),动态与物理交互仍是空白。
关键参考
Hunyuan3D GitHub · World Labs 博客(Marble/RTFM/Atlas 技术文)

4世界模型(岗位核心章)

World Models(Ha & Schmidhuber, 2018)P0

一句话定义
现代世界模型的奠基论文:智能体 = V(视觉压缩,VAE)+ M(记忆预测,RNN 预测未来表征)+ C(控制器,基于预测做动作),并首次证明智能体可以完全在自己「梦」出来的模拟环境里学会玩赛车与射击游戏。
直觉解释
「先在脑子里演练,再上场」——运动员的心理意象训练(mental rehearsal)的机器版。
为什么重要
所有后续工作(Dreamer、Genie、Cosmos)都是这篇的思想后裔;「训练在梦里、执行在现实」的范式是具身智能降低数据成本的根本逻辑。面试引用这篇 = 展示你知道领域原点。
关键参考
论文 arXiv:1803.10122 · 交互式网页版(可视化极佳,强烈推荐体验)

Dreamer 系列(DeepMind,v1 2020 → v3 2023 → v4 2025)P1

一句话定义
在潜空间(latent space)世界模型中「做梦」训练策略的算法家族:v3 用一套超参数掌握 150+ 任务、并首次在 Minecraft 从零挖到钻石;v4(2025 末)进一步做到仅靠离线视频数据(不与真实环境交互)在 Minecraft 挖到钻石。
直觉解释
「做梦派」:把画面压缩成抽象向量,在向量空间里快进未来——不用画出一棵树的每片叶子,只需知道「树会挡住路」。预测发生在概念层而非像素层,所以又快又省。
为什么重要
潜空间路线的最强实证,与 LeCun 的 JEPA 思想呼应;「离线视频学习」(v4)意味着互联网海量视频可以变成机器人教材——这是数据飞轮叙事的关键一环。
关键参考
DreamerV3 arXiv:2301.04104 · Danijar Hafner 项目主页(v1–v4 全系列)

Genie 1 / 2 / 3(DeepMind)P0

一句话定义
「生成式交互环境」系列:Genie(2024-02,ICML 最佳论文)从无标注游戏视频学出可用动作操控的 2D 世界;Genie 2(2024-12)扩展到可交互 3D 世界;Genie 3(2025-08-05)成为通用实时世界模型——文本生成可探索环境、720p/24fps、分钟级场景一致性、支持「可提示的世界事件」(promptable world events,打字让天下雨),并接入 SIMA 具身 agent 做训练环境。
直觉解释
「神经游戏引擎」:没有代码、没有资产库,整个世界由模型逐帧「想」出来,你的操作实时改写世界。Genie 最妙的设计是「潜动作」(latent actions)——训练视频里没有按键记录,模型自己从画面变化中推断出「隐形遥控器」。
为什么重要
交互式世界模型的标杆与风向标:2026-01 起以 Project Genie 形态向 Google AI Ultra($200/月)订阅用户开放,2026-05 支持绑定 Street View 真实坐标——从研究预览走向消费产品与机器人训练双重身份。JD「打破 GUI 的交互」的最佳具象。
关键参考
Genie 3 官方页 · Project Genie 开放公告(2026-01-29) · Genie 论文

神经游戏引擎:GameNGen · DIAMOND · Decart Oasis P2

一句话定义
用扩散模型实时生成经典游戏画面的三部曲:GameNGen(Google,2024-08,神经网络实时跑 DOOM,20fps);DIAMOND(2024-05,扩散世界模型玩 Atari 与 CS:GO);Oasis(Decart×Etched,2024-10,首个开放可玩的实时 AI Minecraft)。
直觉解释
游戏引擎是「规则+资产渲染」,神经游戏引擎是「模型逐帧预测」——世界不再由代码定义,而由概率定义。
为什么重要
证明「可玩的世界模型」技术可行;Decart 由此成长为以色列首个 AI 独角兽(累计融资 4.5 亿美元级),产品线扩展至 Mirage(实时视频变换)与 DOS 推理优化——值得作为「世界模型原生创业公司」样本跟踪。
关键参考
GameNGen arXiv:2408.14837 · Oasis 官方页

JEPA / V-JEPA 2(LeCun 路线)P1

一句话定义
Joint-Embedding Predictive Architecture:不生成像素,只在抽象表征空间预测「被遮挡/未来部分」的表征。V-JEPA 2(Meta,2025-06-12 开源):100 万小时互联网视频自监督预训练 + 仅 62 小时机械臂数据做动作条件化(V-JEPA 2-AC),实现新环境零样本抓取规划(MPC 模型预测控制)。
直觉解释
你预测「球会滚到沙发底下」时,脑中并没有渲染出球的每个像素——你预测的是「概念」。JEPA 就是把预测发生在概念层这一认知直觉工程化。
为什么重要
与视频生成派针锋相对的路线,样本效率是杀手级论据(62 小时 vs 互联网规模视频);LeCun 带着这条路线创立 AMI Labs(2026-01 启动,融资超 10 亿美元),2026-07 发布部署中持续学习的 AdaJEPA。面试聊「世界模型路线之争」,JEPA 是绕不开的一极。
关键参考
V-JEPA 2 论文 arXiv:2506.09985 · Meta V-JEPA 官方页 · LeCun 2022 立场论文《A Path Towards Autonomous Machine Intelligence》

具身/仿真世界模型:NVIDIA Cosmos · GAIA-2 · GR00T P1

一句话定义
专为 Physical AI(机器人/自动驾驶)服务的世界基础模型:NVIDIA Cosmos(2025-01 CES 发布;Cosmos-Predict2.5 统一 Text2World/Image2World/Video2World,2 亿视频片段训练;Cosmos-Reason1 物理推理 VLM;Cosmos 3(2026-06)用 Mixture-of-Transformers 统一语言/图像/视频/音频/动作五模态,开源)。Wayve GAIA-2(2025-03):8.4B 潜扩散驾驶世界模型,最多 5 路摄像头 448×960 一致生成,可按地理/天气/时间/agent 行为精细控制,专造 corner case。NVIDIA Isaac GR00T 为人形机器人基础模型,与 Cosmos 合成数据管线配套。
直觉解释
「数据工厂」:现实里采集一次事故场景要几个月且危险,世界模型在云端按参数批量制造(新轨迹/新视角/新天气/新交互)。机器人先在 Cosmos 造的「驾校」里毕业,再上真实道路。
为什么重要
世界模型目前最清晰的 B 端付费市场;2026-03 GTC 上 ABB/FANUC/Figure/Agility 等机器人巨头集体站队 NVIDIA Physical AI 生态。JD 场景②「自动驾驶/具身仿真」的技术底座就在这条线。
关键参考
NVIDIA Cosmos 官方页 · Cosmos-Predict2.5 arXiv:2511.00062 · GAIA-2 发布稿 · GAIA-1 arXiv:2309.17080

空间智能:World Labs(Marble / RTFM / Atlas)与腾讯 HY-World P0

一句话定义
「生成持久化可交互 3D 世界」路线:World Labs(李飞飞 2024 年创立,联创含 Justin Johnson、Christoph Lassner、NeRF 作者 Ben Mildenhall)的 Marble(2025-11-12 商用:文本/照片/视频/3D 布局/全景图 → 可编辑、可导出 3DGS/Mesh/视频的持久世界,freemium);RTFM(实时帧生成世界模型,与 Marble「先建世界再进入」互补);Atlas(2026-09-02:从零训练的全模态 omni model,像素级相机控制生成最长 1 分钟 1440p 视频,并可将照片/视频重建为点云与 3DGS,官方定位覆盖影视/游戏与机器人仿真)。腾讯 HY-World 1.0(2025-07)/2.0(2026-04 开源,含 WorldMirror 重建、HY-Pano 全景、WorldStereo):生成的 3DGS/Mesh 世界支持自由行走与物理碰撞、无缝对接 Unity/UE。
直觉解释
视频派「画」出世界(每帧重新想象),3D 派「建」出世界(一次建成、处处一致、随时可回去)。Marble 的赌注:持久化 + 可导出比实时流式更有工业价值。
为什么重要
李飞飞的「空间智能(Spatial Intelligence)」叙事 = 世界模型的另一半版图;World Labs 2026-02 融资 10 亿美元(Autodesk 2 亿领投跟投方含 AMD/NVIDIA/Fidelity),说明 3D 工具链巨头已在押注。这条线与 JD 的「多视角生成」「XR」「3DGS」直接相关。
关键参考
World Labs 博客(Marble/Atlas 一手技术文) · HY-World 2.0 GitHub · Atlas 中文深度报道(MIT 科技评论中国)

5交互范式:从 prompt 到打破 GUI

控制信号的五级阶梯 P0

一句话定义
生成式内容产品的交互本质 = 「用户如何把意图注入模型」,2024–2026 已演化出五级控制信号:
Prompt(自然语言)→ ② 参考素材(图片/视频/音频混合参考:Seedance 2.0 的 9 图 3 视频 3 音频;Marble 的 3D 布局输入)→ ③ 轨迹/镜头控制(相机路径、首尾帧:Veo 3.1 首尾帧、Luma Ray3.2 十六关键帧、Runway 镜头指令;涂鸦控镜头:Ray3)→ ④ 动作/事件条件(实时交互世界:Genie 3 的 WASD + promptable world events)→ ⑤ 物理参数/规则(仿真级控制:GAIA-2 的天气/地理/agent 行为条件,Cosmos 的动作序列输入)。
直觉解释
从「对画师说一句话」到「给画师参考图」到「亲手握着画师的手」到「走进画里」——控制粒度越来越细,交互带宽越来越大。
为什么重要
这就是 JD「设计打破 GUI 的新型交互」的知识地图。你的 Agent 路由经验对应「多信号输入怎么理解与分发」;canvas 上下文管理对应「哪些参考进上下文」。产品判断框架:控制力 vs 易用性永远此消彼长,专业创作者要 ③⑤,大众用户停在 ①②。
关键参考
Genie 3(④ 级交互实例) · Seedance 2.0 发布文(② 级多素材参考实例)

打破 GUI:对话式导演 · 生成式画布 · 具身界面 P1

一句话定义
三种「后 GUI」交互形态正在成型:对话式导演(Gemini Omni Flash / Pika Agents:多轮自然语言迭代修改视频,「把车换成红色,镜头拉远」);生成式画布(可灵「灵动画布 Agent」、Runway Edit Studio、你的 Web canvas 经验所属形态:素材、指令、版本在空间化画布上组织,Agent 编排生成链路);具身/空间界面(Genie 3 的实时世界探索、XR 中以手势/视线/身体为输入、Project Genie 绑定 Street View 真实坐标)。
直觉解释
GUI 的隐喻是「表单与按钮」——把意图翻译成控件操作;生成式交互的隐喻是「导演与片场」——直接表达意图,世界响应你。GUI 是「操作工具」,新范式是「指挥世界」。
为什么重要
JD 原话「能设计打破 GUI 的新型交互」。面试准备一个你自己的构想(例:把剪映时间线升级为「世界时间线」——每个镜头是一段可进入漫游的 3DGS 世界,剪辑=在多个世界间切换机位)。你的 canvas + Agent 路由背景让这个故事完全可信。
关键参考
Runway Edit Studio · Project Genie

空间计算 / XR 语境 P2

一句话定义
空间计算(Spatial Computing)= 以三维空间为界面的计算范式(Apple Vision Pro 定义的话语体系);XR(VR/AR/MR 总称)是其载体。世界模型与 XR 的关系:XR 最大瓶颈是 3D 内容供给,而 3D 生成(Marble/HY-World/Hunyuan3D)正是供给侧革命。
为什么重要
JD 场景②点名 XR。认知级即可:知道 visionOS 的空间锚定/透视、3DGS 在头显端渲染的可行性、以及「生成世界 → 导出引擎 → 头显漫游」这条链路。
关键参考
Apple visionOS 开发者站
← 上一章
World Model 101
下一章 →
玩家与格局