板块 8 / 10

论文与资源库:按需深挖,不必通读

PM 读论文的正确姿势:读标题 → 读摘要 → 看图表 → 读结论,10 分钟一篇;只有 ★ 标注的 6 篇建议精读。所有链接为 arXiv/官方一手来源。

1关键论文清单(按主线分组)

A. 世界模型核心(先读这组)

论文年份一句话理由链接
★ World Models(Ha & Schmidhuber)2018领域奠基之作;网页版可视化极佳,2 小时可「玩」完arXiv:1803.10122 · 交互网页
★ A Path Towards Autonomous Machine Intelligence(LeCun)2022JEPA 与世界模型认知架构的纲领性立场文,路线之争的源头OpenReview
★ Video generation models as world simulators(Sora 技术报告)2024「视频生成=世界模拟」命题出处;短小,必读OpenAI
Dream to Control(Dreamer v1)2020潜空间「做梦训练」范式的起点arXiv:1912.01603
★ Mastering Diverse Domains(DreamerV3)2023一套超参数通吃 150+ 任务、Minecraft 挖钻石;潜空间路线成熟标志arXiv:2301.04104
★ Genie: Generative Interactive Environments2024ICML 2024 最佳论文;从视频学出可交互世界,「潜动作」概念必读arXiv:2402.15391
Genie 3(官方技术页)2025实时交互世界模型标杆;720p/24fps/分钟级一致/promptable world eventsDeepMind
V-JEPA 2202562 小时机器人数据零样本规划;LeCun 路线最强实证arXiv:2506.09985
Diffusion Models Are Real-Time Game Engines(GameNGen)2024神经网络实时跑 DOOM,「神经游戏引擎」概念证明arXiv:2408.14837
DIAMOND(扩散世界模型玩 Atari/CS:GO)2024扩散路线做交互世界模型的代表arXiv:2405.12399
Oasis(Decart,可玩 AI Minecraft)2024首个开放可玩的实时生成世界Decart
综述:Video Generation Models as World Models2026最新系统综述,梳理「视频生成作为世界模型」的范式/架构/算法(面试前扫目录)arXiv:2603.28489

B. 生成式基础(补直觉)

论文年份一句话理由链接
Attention Is All You Need(Transformer)2017不需要精读,读图解博客即可arXiv:1706.03762
DDPM(去噪扩散)2020扩散模型奠基;配合 Lilian Weng 博客读arXiv:2006.11239
High-Resolution Image Synthesis(Latent Diffusion / Stable Diffusion)2022潜空间扩散,现代视频模型的直接祖先arXiv:2112.10752
★ Scalable Diffusion Models with Transformers(DiT)2022Sora/可灵/Cosmos 的架构基础,必读(图很友好)arXiv:2212.09748
CLIP2021文图对齐,多模态的基石arXiv:2103.00020
ViT(Vision Transformer)2020图像 patch 化思想的出处(连接 DiT 的时空 patch)arXiv:2010.11929

C. 3D 表示与生成

论文/资料年份一句话理由链接
★ NeRF2020ECCV 最佳论文;隐式 3D 表示的开山作,项目页演示必看arXiv:2003.08934 · 项目页
★ 3D Gaussian Splatting2023SIGGRAPH 2023;当前 3D 世界模型的事实标准表示arXiv:2308.04079 · 项目页
HunyuanVideo(腾讯)2024开源视频基座系统框架arXiv:2412.03603
HunyuanVideo 1.5 技术报告20258.3B 消费级显卡可跑;成本地板的定义者arXiv:2511.18870
HY-World 2.0(腾讯混元世界模型)2026多模态输入 → 可漫游 3DGS/Mesh 世界、对接 Unity/UE 的开源工程范例arXiv:2604.14268 · GitHub
World Labs 博客(Marble / RTFM / Atlas 技术文)2025–26空间智能路线的一手阐述,产品味浓,PM 最好读worldlabs.ai/blog

D. 具身 / 自动驾驶仿真

论文/资料年份一句话理由链接
Cosmos World Foundation Model Platform(NVIDIA)2025Physical AI 世界基座平台的完整阐述arXiv:2501.03575
Cosmos-Predict2.5(世界模拟技术报告)2025Text2World/Image2World/Video2World 统一 + 2 亿视频片段训练细节arXiv:2511.00062
GAIA-1(Wayve)2023自动驾驶生成世界模型开山作arXiv:2309.17080
GAIA-2(Wayve 技术报告)2025多视角可控驾驶世界模型;corner case 数据工厂范式的代表Wayve PDF
综述:A Survey of Embodied World Models2026具身世界模型系统综述(预印本),建立分类学用Preprints

2课程与系统教程

课程适合点链接
DeepLearning.AI《How Diffusion Models Work》(Sharon Zhou,短课)扩散模型直觉速成,1–2 小时,PM 首选入门deeplearning.ai
Hugging Face Diffusion Course免费系统课,从原理到代码,可选读前 3 章huggingface.co
Andrej Karpathy《Neural Networks: Zero to Hero》建立神经网络/Transformer 第一性直觉(可只看前 2 讲)karpathy.ai
MIT 6.S184《Generative AI with Diffusion Models》(Vincent Sitzmann,NeRF 方向学者)系统覆盖扩散+视觉生成,含 3D 内容,有公开讲义(开设年份待核实)MIT
Stanford CS231n(卷积网络与视觉识别)CV 常识底座,只看讲义与第 1–5 讲即可Stanford
李沐《动手学深度学习》(中文)中文最佳系统教材,按需查阅 Transformer/CV 章节d2l.ai
李宏毅机器学习课程(中文视频)中文视频课,生成式 AI 专题通俗易懂NTU

3博客 · 资讯 · 社区

技术博客(英文)

中文资讯

跟踪清单(Awesome Lists / 榜单)

4信息跟踪方法:每月 2 小时保鲜计划

  1. 周一(30 min):扫 HF Daily Papers 上周热榜 + Artificial Analysis 视频榜单变化 → 只记「新面孔」。
  2. 月中(40 min):过一遍官方博客 RSS:OpenAI / DeepMind / World Labs / NVIDIA / 字节 Seed / 腾讯混元 / 快手可灵 / Runway / Luma / Decart。
  3. 月末(30 min):财报与融资:快手(可灵收入)、MiniMax、NVIDIA、各创业公司融资新闻;更新你的「格局表」(玩家页总表复制一份自己维护)。
  4. 每季度(20 min):重读 四大路线,问自己:哪条路线的证据变强了?更新你的面试观点。

5动手清单(建立体感,各 30–60 分钟)

体验项目的入口成本
即梦 / 可灵 免费版各生成 10 条视频建立国产模型能力边界体感(你的主场,必须最熟)即梦 · 可灵免费额度
Luma Dream Machine 试用涂鸦控镜头/关键帧体验「导演式控制」交互Dream Machine免费额度
World Labs Marble 生成一个 3D 世界并导出体验「持久化 3D 世界」与视频派的本质区别worldlabs.ai免费版
World Models 交互网页版「玩」懂 V-M-C 架构与梦中训练worldmodels.github.io免费
看 Decart Oasis / Project Genie 演示视频并试玩(若可访问)建立「实时交互世界」的延迟与漂移体感decart.ai · Genie免费/订阅
Hugging Face 上跑 Hunyuan3D Space:单图转 3D体验前馈式 3D 生成质量与速度HF Spaces 搜 Hunyuan3D免费
Blender 4.x 基础操作(官方 2 小时入门)理解 3D 资产管线术语(建模/材质/灯光/渲染)blender.org免费
⚠️ 使用提醒
部分链接(课程开设年份、第三方站点)可能随时间失效或变更,访问失败时用论文标题搜索即可。标注「待核实」的条目引用前请自行确认。
← 上一章
商业化与生态
下一章 →
个性化学习路径