板块 10 / 10

术语表 + 面试准备

术语表按主题分组,中英对照 + PM 够用的一句话解释(面试前每天扫一遍)。面试准备按五类题型给出「答题要点框架」——不要背本站答案,用框架组织你自己的经历。

1术语表(约 60 条)

🧠 世界模型核心

术语英文PM 够用的解释
世界模型World ModelAI 内部的可计算世界模拟:给定当前状态与动作,预测世界接下来会怎样
世界模拟器World SimulatorOpenAI 对 Sora 的定位用语:视频生成模型规模化后涌现出世界模拟能力(存在争议)
空间智能Spatial Intelligence李飞飞/World Labs 的叙事:AI 理解与创造三维空间的能力,语言智能之后的下一前沿
物理 AIPhysical AINVIDIA 的叙事:能与物理世界交互的 AI(机器人/自动驾驶),世界模型是其数据与训练基座
具身智能Embodied AI / Embodiment有身体(传感器+执行器)的智能体,通过与环境交互学习;世界模型的最大需求方
动作条件生成Action-conditioned Generation把「动作」作为输入的生成:按 W 键世界向前走——交互式世界模型的技术核心
潜动作Latent ActionsGenie 的发明:从无按键标注的视频中自动推断出「隐形控制信号」
可提示的世界事件Promptable World EventsGenie 3 功能:在实时交互中打字改变世界(让天下雨)——语言与交互的融合
模型预测控制MPC (Model Predictive Control)控制方法:用世界模型向前推演多种动作序列,选最优的执行(V-JEPA 2 用它做零样本规划)
零样本规划Zero-shot Planning没见过的环境/任务,不重新训练直接规划执行
Sim-to-Real GapSim-to-Real Gap仿真中训练的策略到真实世界的性能落差;世界模型的价值就是缩小它
长尾场景 / Corner CaseCorner Case罕见但关键的场景(鬼探头/极端天气);世界模型作为「数据工厂」批量制造它们
物体恒存性Object Permanence物体被遮挡后仍然存在——Sora 报告用它论证「涌现的世界理解」,也是视频模型最常翻车点
数字孪生Digital Twin物理实体/系统的实时数字镜像(工厂/城市);世界模型是「可预测的数字孪生」

🎬 生成式基础与视频生成

术语英文PM 够用的解释
Transformer / 注意力Transformer / Attention现代生成模型的公共骨架;注意力=处理每个元素时动态决定参考哪些其他元素
扩散模型Diffusion Model从噪声逐步去噪生成内容的范式;「抽卡」随机性的来源
去噪扩散概率模型DDPM扩散模型的奠基之作(2020)
潜空间扩散Latent Diffusion (LDM)先压缩到潜空间再去噪,省算力;Stable Diffusion 与几乎所有视频模型的基础
扩散 TransformerDiT用 Transformer 做扩散骨架;Sora 采用后成为视频生成标配架构
时空 patchSpacetime PatchesSora 把视频切成三维小块当 token,从而支持任意分辨率/时长/宽高比
自回归Autoregressive (AR)逐元素预测下一个(LLM 逐 token、交互世界模型逐帧);实时交互的前提
流匹配Flow Matching扩散的加速训练/采样框架(学「噪声→数据」的流场);GAIA-2、Cosmos 等在用
VAE / 分词器VAE / Tokenizer把图像视频压缩成潜表示的编解码器;视频模型的「压缩前端」
图生视频 / 文生视频 / 视频生视频I2V / T2V / V2V按输入模态划分的产品形态;V2V 即指令式视频编辑(Aleph)的技术类别
一致性Consistency统称四类:时序一致(帧间不闪)、角色一致(脸不变)、场景/世界一致(跨镜头环境不变,Runway Gen-4 卖点)、多视角一致(换机位不崩)
可用率Usability Rate生成结果可直接使用的比例;Seedance 2.0 宣称复杂场景 >90%(行业平均曾 <20%)——广告场景第一指标
音画同步 / 原生音频Native Audio / Lip-sync模型直接生成与画面同步的对白音效(Veo 3、Sora 2、Seedance 2.0 的竞赛点)
首尾帧控制First/Last Frame Control给定起始与结束画面让模型补中间——精确控制的核心工具(Veo 3.1 等支持)
关键帧控制Keyframe Control给多个关键画面让生成经过它们(Luma Ray3.2 支持 16 个)
蒸馏Distillation用大模型教小模型/多步教少步,降推理成本的主要手段
控制网络ControlNet给扩散模型加空间条件控制(边缘/深度/姿态)的插件式架构
抽卡—(行业黑话)反复生成碰运气;「终结抽卡」= 2025–2026 中国视频模型的产品主叙事

🧊 3D 与 XR

术语英文PM 够用的解释
神经辐射场NeRF用神经网络隐式编码场景,任意机位渲染逼真新视角;慢,已被 3DGS 大面积取代
3D 高斯泼溅3D Gaussian Splatting (3DGS)用几十万个彩色高斯椭球显式表示场景,实时渲染;当前 3D 世界模型的事实标准输出格式
新视角合成Novel View Synthesis从已拍画面生成没拍过的机位画面——「多视角生成」的学术名称
隐式 / 显式表示Implicit / Explicit Representation隐式=网络函数编码(NeRF/SDF);显式=直接存几何(Mesh/点云/体素/3DGS)
网格 / 点云 / 体素Mesh / Point Cloud / Voxel三种显式几何:面片/点集合/三维像素
SDF 符号距离场Signed Distance Field隐式表示的一种:每点存「到表面的距离」
前馈式 3D 生成Feed-forward 3D Generation大模型一次推理直接出 3D(vs 每场景优化数小时);Hunyuan3D/TRELLIS/Marble
摄影测量Photogrammetry从多张照片重建 3D 的传统技术;被神经方法升级
USD / glTFUSD / glTF3D 资产交换格式:USD 是皮克斯/苹果/NVIDIA 推的工业协作标准(Omniverse 基础),glTF 是 Web/引擎通用格式
PBR 材质PBR (Physically Based Rendering)基于物理的渲染材质(金属度/粗糙度贴图);「游戏可用资产」的标配
虚拟制片Virtual ProductionLED 墙+游戏引擎实时渲染拍片(《曼达洛人》工艺);生成式 3D 场景的新出口
空间计算 / XRSpatial Computing / XR以三维空间为界面的计算范式(Vision Pro 话语体系)/ VR·AR·MR 总称

🤖 具身 / RL / 架构流派

术语英文PM 够用的解释
强化学习RL (Reinforcement Learning)智能体通过试错与奖励学习策略;世界模型让试错发生在「梦里」
智能体 / 环境 / 奖励Agent / Environment / RewardRL 三要素;世界模型扮演的就是「环境」的可学习替身
潜空间世界模型Latent World Model在压缩表征空间预测未来(Dreamer/JEPA 路线),省算力、样本效率高
JEPA 联合嵌入预测架构Joint-Embedding Predictive ArchitectureLeCun 路线:不生成像素,只预测抽象表征的未来;V-JEPA 2 / AdaJEPA / AMI Labs 的基础
VLA 模型Vision-Language-Action Model视觉-语言-动作一体的机器人大模型(Figure Helix、NVIDIA GR00T);世界模型知识的「消费端」
世界基础模型World Foundation Model (WFM)NVIDIA Cosmos 的定位用语:可微调到各类物理 AI 任务的预训练世界模型
全模态模型Omni Model统一处理文/图/视频/音频/动作的单一模型(Cosmos 3、World Labs Atlas);2026 年的架构趋势
混合 TransformerMixture-of-Transformers (MoT)按模态分工的 Transformer 变体(Cosmos 3 架构);与 MoE(专家混合)区分
神经游戏引擎Neural Game Engine用模型逐帧生成取代传统渲染管线(GameNGen/Oasis/Genie)
遥操作Teleoperation人操控机器人采集示教数据;具身数据最贵的采集方式
合成数据Synthetic Data由模型/仿真生成的训练数据;世界模型的核心商业产出物

2面试准备:五类题型 × 答题框架

题型一:技术理解类(筛掉不懂行的 PM)

题型二:行业判断类(考格局观)

题型三:产品设计类(现场出题)

题型四:商业化类(你的主场,要打出满分)

题型五:个人叙事类(把背景翻译成岗位语言)

🎯 反问环节清单(展示你的段位)

✅ 最后一遍自检(面试当天早晨)
① 3 分钟世界模型讲稿 ✓ ② 格局图能默画 ✓ ③ Sora 复盘三层归因 ✓ ④ 四大路线+代表产品 ✓ ⑤ 五件套作品集可展示 ✓ ⑥ 三个反问 ✓ ⑦ 60 秒自我介绍(世界模型版)✓ ——全勾就上。
← 上一章
个性化学习路径
回到
首页 · 学习地图