术语表按主题分组,中英对照 + PM 够用的一句话解释(面试前每天扫一遍)。面试准备按五类题型给出「答题要点框架」——不要背本站答案,用框架组织你自己的经历。
| 术语 | 英文 | PM 够用的解释 |
|---|---|---|
| 世界模型 | World Model | AI 内部的可计算世界模拟:给定当前状态与动作,预测世界接下来会怎样 |
| 世界模拟器 | World Simulator | OpenAI 对 Sora 的定位用语:视频生成模型规模化后涌现出世界模拟能力(存在争议) |
| 空间智能 | Spatial Intelligence | 李飞飞/World Labs 的叙事:AI 理解与创造三维空间的能力,语言智能之后的下一前沿 |
| 物理 AI | Physical AI | NVIDIA 的叙事:能与物理世界交互的 AI(机器人/自动驾驶),世界模型是其数据与训练基座 |
| 具身智能 | Embodied AI / Embodiment | 有身体(传感器+执行器)的智能体,通过与环境交互学习;世界模型的最大需求方 |
| 动作条件生成 | Action-conditioned Generation | 把「动作」作为输入的生成:按 W 键世界向前走——交互式世界模型的技术核心 |
| 潜动作 | Latent Actions | Genie 的发明:从无按键标注的视频中自动推断出「隐形控制信号」 |
| 可提示的世界事件 | Promptable World Events | Genie 3 功能:在实时交互中打字改变世界(让天下雨)——语言与交互的融合 |
| 模型预测控制 | MPC (Model Predictive Control) | 控制方法:用世界模型向前推演多种动作序列,选最优的执行(V-JEPA 2 用它做零样本规划) |
| 零样本规划 | Zero-shot Planning | 没见过的环境/任务,不重新训练直接规划执行 |
| Sim-to-Real Gap | Sim-to-Real Gap | 仿真中训练的策略到真实世界的性能落差;世界模型的价值就是缩小它 |
| 长尾场景 / Corner Case | Corner Case | 罕见但关键的场景(鬼探头/极端天气);世界模型作为「数据工厂」批量制造它们 |
| 物体恒存性 | Object Permanence | 物体被遮挡后仍然存在——Sora 报告用它论证「涌现的世界理解」,也是视频模型最常翻车点 |
| 数字孪生 | Digital Twin | 物理实体/系统的实时数字镜像(工厂/城市);世界模型是「可预测的数字孪生」 |
| 术语 | 英文 | PM 够用的解释 |
|---|---|---|
| Transformer / 注意力 | Transformer / Attention | 现代生成模型的公共骨架;注意力=处理每个元素时动态决定参考哪些其他元素 |
| 扩散模型 | Diffusion Model | 从噪声逐步去噪生成内容的范式;「抽卡」随机性的来源 |
| 去噪扩散概率模型 | DDPM | 扩散模型的奠基之作(2020) |
| 潜空间扩散 | Latent Diffusion (LDM) | 先压缩到潜空间再去噪,省算力;Stable Diffusion 与几乎所有视频模型的基础 |
| 扩散 Transformer | DiT | 用 Transformer 做扩散骨架;Sora 采用后成为视频生成标配架构 |
| 时空 patch | Spacetime Patches | Sora 把视频切成三维小块当 token,从而支持任意分辨率/时长/宽高比 |
| 自回归 | Autoregressive (AR) | 逐元素预测下一个(LLM 逐 token、交互世界模型逐帧);实时交互的前提 |
| 流匹配 | Flow Matching | 扩散的加速训练/采样框架(学「噪声→数据」的流场);GAIA-2、Cosmos 等在用 |
| VAE / 分词器 | VAE / Tokenizer | 把图像视频压缩成潜表示的编解码器;视频模型的「压缩前端」 |
| 图生视频 / 文生视频 / 视频生视频 | I2V / T2V / V2V | 按输入模态划分的产品形态;V2V 即指令式视频编辑(Aleph)的技术类别 |
| 一致性 | Consistency | 统称四类:时序一致(帧间不闪)、角色一致(脸不变)、场景/世界一致(跨镜头环境不变,Runway Gen-4 卖点)、多视角一致(换机位不崩) |
| 可用率 | Usability Rate | 生成结果可直接使用的比例;Seedance 2.0 宣称复杂场景 >90%(行业平均曾 <20%)——广告场景第一指标 |
| 音画同步 / 原生音频 | Native Audio / Lip-sync | 模型直接生成与画面同步的对白音效(Veo 3、Sora 2、Seedance 2.0 的竞赛点) |
| 首尾帧控制 | First/Last Frame Control | 给定起始与结束画面让模型补中间——精确控制的核心工具(Veo 3.1 等支持) |
| 关键帧控制 | Keyframe Control | 给多个关键画面让生成经过它们(Luma Ray3.2 支持 16 个) |
| 蒸馏 | Distillation | 用大模型教小模型/多步教少步,降推理成本的主要手段 |
| 控制网络 | ControlNet | 给扩散模型加空间条件控制(边缘/深度/姿态)的插件式架构 |
| 抽卡 | —(行业黑话) | 反复生成碰运气;「终结抽卡」= 2025–2026 中国视频模型的产品主叙事 |
| 术语 | 英文 | PM 够用的解释 |
|---|---|---|
| 神经辐射场 | NeRF | 用神经网络隐式编码场景,任意机位渲染逼真新视角;慢,已被 3DGS 大面积取代 |
| 3D 高斯泼溅 | 3D Gaussian Splatting (3DGS) | 用几十万个彩色高斯椭球显式表示场景,实时渲染;当前 3D 世界模型的事实标准输出格式 |
| 新视角合成 | Novel View Synthesis | 从已拍画面生成没拍过的机位画面——「多视角生成」的学术名称 |
| 隐式 / 显式表示 | Implicit / Explicit Representation | 隐式=网络函数编码(NeRF/SDF);显式=直接存几何(Mesh/点云/体素/3DGS) |
| 网格 / 点云 / 体素 | Mesh / Point Cloud / Voxel | 三种显式几何:面片/点集合/三维像素 |
| SDF 符号距离场 | Signed Distance Field | 隐式表示的一种:每点存「到表面的距离」 |
| 前馈式 3D 生成 | Feed-forward 3D Generation | 大模型一次推理直接出 3D(vs 每场景优化数小时);Hunyuan3D/TRELLIS/Marble |
| 摄影测量 | Photogrammetry | 从多张照片重建 3D 的传统技术;被神经方法升级 |
| USD / glTF | USD / glTF | 3D 资产交换格式:USD 是皮克斯/苹果/NVIDIA 推的工业协作标准(Omniverse 基础),glTF 是 Web/引擎通用格式 |
| PBR 材质 | PBR (Physically Based Rendering) | 基于物理的渲染材质(金属度/粗糙度贴图);「游戏可用资产」的标配 |
| 虚拟制片 | Virtual Production | LED 墙+游戏引擎实时渲染拍片(《曼达洛人》工艺);生成式 3D 场景的新出口 |
| 空间计算 / XR | Spatial Computing / XR | 以三维空间为界面的计算范式(Vision Pro 话语体系)/ VR·AR·MR 总称 |
| 术语 | 英文 | PM 够用的解释 |
|---|---|---|
| 强化学习 | RL (Reinforcement Learning) | 智能体通过试错与奖励学习策略;世界模型让试错发生在「梦里」 |
| 智能体 / 环境 / 奖励 | Agent / Environment / Reward | RL 三要素;世界模型扮演的就是「环境」的可学习替身 |
| 潜空间世界模型 | Latent World Model | 在压缩表征空间预测未来(Dreamer/JEPA 路线),省算力、样本效率高 |
| JEPA 联合嵌入预测架构 | Joint-Embedding Predictive Architecture | LeCun 路线:不生成像素,只预测抽象表征的未来;V-JEPA 2 / AdaJEPA / AMI Labs 的基础 |
| VLA 模型 | Vision-Language-Action Model | 视觉-语言-动作一体的机器人大模型(Figure Helix、NVIDIA GR00T);世界模型知识的「消费端」 |
| 世界基础模型 | World Foundation Model (WFM) | NVIDIA Cosmos 的定位用语:可微调到各类物理 AI 任务的预训练世界模型 |
| 全模态模型 | Omni Model | 统一处理文/图/视频/音频/动作的单一模型(Cosmos 3、World Labs Atlas);2026 年的架构趋势 |
| 混合 Transformer | Mixture-of-Transformers (MoT) | 按模态分工的 Transformer 变体(Cosmos 3 架构);与 MoE(专家混合)区分 |
| 神经游戏引擎 | Neural Game Engine | 用模型逐帧生成取代传统渲染管线(GameNGen/Oasis/Genie) |
| 遥操作 | Teleoperation | 人操控机器人采集示教数据;具身数据最贵的采集方式 |
| 合成数据 | Synthetic Data | 由模型/仿真生成的训练数据;世界模型的核心商业产出物 |