← 资料库

AI视频技术原理与权威综述

正式研究卡核验 2026-07-23

本页不教公式推导,而是回答:今天常见的视频扩散、DiT、视频 tokenizer、流匹配、参考控制和量化从哪里来,分别解决什么问题。论文的实验结论只在其数据、算力和评测条件内成立。

2016|Generating Videos with Scene Dynamics

  • 资料身份:NeurIPS 2016 论文;A3 · historical。
  • 这篇原文具体讲什么:论文把视频分成相对静态的背景和运动前景,用时空卷积 GAN 从未标注视频中学习场景动态,生成约一秒的低分辨率短片,并测试模型对未来帧预测和动作识别的帮助。今天看画质已经非常原始,但“外观与运动要分别建模”的问题一直延续到后来的角色一致性、运动控制与相机控制。
  • 为什么值得读:它让人看到视频生成最初不是“图片多生成几帧”,而是要同时保持场景并产生合理变化。理解这条矛盾,比记忆某个模型的提示词更持久。
  • 阅读前要知道:这是早期 GAN 研究,不能据此判断现代扩散模型质量;样本短、分辨率低、数据规模也远小于今天。
  • 建议:仅追溯历史;重点看 two-stream generator 与 failure cases。
  • 原文论文

2017|MoCoGAN:把 Motion 与 Content 分开

  • 资料身份:CVPR 2018 前身论文;A3 · historical。
  • 这篇原文具体讲什么:MoCoGAN 将每一帧的潜变量拆为固定的内容部分和随时间变化的运动部分,并同时使用图像判别器与视频判别器训练。作者展示了同一人物内容配不同运动、相同运动配不同人物内容的组合实验,用来验证运动与外观可以部分解耦。
  • 为什么值得读:今天“角色不变但动作变化”的目标与这篇高度同源。它也解释了为何角色一致性不能只靠一张人设图:模型内部必须区分稳定身份特征和时间变化特征。
  • 阅读前要知道:所谓解耦是模型和实验条件下的结果,不代表完全可解释;GAN 路线的训练稳定性、分辨率和长程一致性均有限。
  • 建议:角色一致性专题必读;重点看 latent decomposition 和 cross-combination experiments。
  • 原文论文

2021|Latent Diffusion Models

  • 资料身份:CVPR 2022 论文;A3 · foundational。
  • 这篇原文具体讲什么:Latent Diffusion 先用自编码器把像素压缩到较小潜空间,再在潜空间执行扩散去噪,从而大幅降低高分辨率生成的计算量,并以 cross-attention 接入文本等条件。论文主体是图像生成,但“先压缩视觉,再在潜空间扩散”成为后续大量视频模型的基本工程思想。
  • 为什么值得读:视频比图像多一条时间轴,直接在像素空间生成成本更高。理解 VAE 压缩、潜空间损失和条件注入,可以解释为什么视频会出现细节模糊、纹理漂移,也能理解本地模型为什么依赖显存优化。
  • 阅读前要知道:它不是视频模型论文;把其结论外推到视频时必须结合视频 VAE、时间压缩与后续架构。
  • 建议:技术地基必读;重点看 perceptual compression、latent diffusion 与 conditioning。
  • 原文论文 · 官方代码

2022|Video Diffusion Models

  • 资料身份:论文;A3 · foundational。
  • 这篇原文具体讲什么:Google 研究团队把扩散模型扩展到视频,使用时间维度的模型组件,并研究图像与视频联合训练、条件视频生成和视频超分辨率。一个重要工程结论是:大量图像数据能帮助外观学习,较少但昂贵的视频数据负责运动学习,从而提高视频训练效率。
  • 为什么值得读:这是现代视频扩散路线的重要起点。它直接揭示“单帧画得好”和“连续运动合理”是两类学习问题,也解释了为什么模型可能拥有漂亮首帧却在后续帧破坏人物与物体。
  • 阅读前要知道:论文中的生成长度、分辨率和算力属于 2022 条件;技术地位重要,但不是当前质量基准。
  • 建议:必读;重点看 image-video joint training、temporal layers 和 super-resolution pipeline。
  • 原文论文

2022|Diffusion Transformer(DiT)

  • 资料身份:ICCV 2023 论文;A3 · foundational。
  • 这篇原文具体讲什么:DiT 用 Transformer 替代扩散模型常见的 U-Net 主干,将潜空间图像切成 patch token,并系统研究模型规模和计算量与生成质量的关系。论文是图像任务,但后来的 Sora、CogVideoX、HunyuanVideo、Wan 等视频模型普遍采用或变形采用 DiT。
  • 为什么值得读:它是理解“为什么当前视频模型越来越像大语言模型式的 Transformer 扩展”的关键。空间和时间 token 可以在统一注意力框架里处理,但计算量会随分辨率、帧数和上下文迅速增长。
  • 阅读前要知道:DiT 本身不保证角色一致、物理正确或长视频;这些仍依赖视频 tokenizer、训练数据、条件控制和推理策略。
  • 建议:技术地基必读;重点看 patchify、adaptive layer norm 与 scaling experiments。
  • 原文论文 · 官方代码

2022|Flow Matching

  • 资料身份:ICLR 2023 论文;A3 · foundational。
  • 这篇原文具体讲什么:Flow Matching 通过学习一个随时间变化的向量场,把简单分布连续运输到数据分布,提供区别于传统逐步噪声预测的生成训练框架。后续很多图像和视频模型采用 rectified flow 或 flow-matching 变体,以改善训练、采样速度或生成路径。
  • 为什么值得读:现在开源仓库频繁出现 flow、velocity、rectified flow、few-step distillation。读这篇能避免把这些词误当营销标签,并理解“采样步数更少”为什么需要训练目标或蒸馏配合。
  • 阅读前要知道:这是通用生成建模论文,不是视频产品说明;实际视频质量和速度取决于具体离散化、模型、蒸馏及硬件实现。
  • 建议:技术专题必读;重点看 conditional probability paths 与 simulation-free training。
  • 原文论文

2024|VideoPoet

  • 资料身份:ICML 2024 论文与 Google Research 项目;A3 · research-only。
  • 这篇原文具体讲什么:VideoPoet 不采用纯扩散主线,而是先把文本、图像、视频和音频转成 token,再用 decoder-only Transformer 做下一 token 预测。一个模型可处理文生视频、图生视频、视频延展、视频编辑、风格化和视频到音频,训练方式更接近大语言模型的预训练与任务适配。
  • 为什么值得读:它是“统一多模态生成器”的早期清晰样板,对 2026 年会话式音视频模型很有前因价值。它说明统一能力不一定来自把多个独立工具串起来,也可以来自共享 token 和自回归模型。
  • 阅读前要知道:论文与样例公开,但没有对应的长期公众产品;样例不能代替开放测试,零样本能力是论文条件下的结论。
  • 建议:统一多模态专题必读;重点看 tokenizers、task formulation、in-context learning 和 limitations。
  • 原文ICML 论文页 · Google 项目页

2025|Survey of Video Diffusion Models

  • 资料身份:综述论文与配套文献仓库;A3 · current-survey。
  • 这篇原文具体讲什么:该综述从扩散基础、视频时序建模、训练工程、条件控制、低层视觉应用、评测指标和工业方案等维度整理视频扩散领域,并附带结构化相关工作列表。它特别讨论运动一致性、计算成本、数据和伦理等仍未解决的问题。
  • 为什么值得读:适合作为资料库的“地图”,用于发现遗漏方向和追溯原始论文,而不是把综述本身当最后证据。其训练工程与评测章节对理解模型为什么昂贵、为什么榜单不稳定尤其有用。
  • 阅读前要知道:arXiv 综述不是同行评审共识;覆盖截止日期固定,2026 新模型需要另行更新;二次归纳仍应回链原论文。
  • 建议:入门研究者必读;先看 taxonomy 和 tables,再按问题进入原论文。
  • 原文综述 · 配套文献仓库

2025|Controllable Video Generation: A Survey

  • 资料身份:控制生成综述;A3 · current-survey。
  • 这篇原文具体讲什么:论文把仅靠文本的控制不足作为出发点,系统整理相机轨迹、深度、边缘、姿态、主体参考、音频及多条件联合控制,进一步区分单条件、多条件和通用控制框架。配套仓库持续汇总相关论文和开源实现。
  • 为什么值得读:它能把“角色一致性工作流”拆成多个真实技术问题:身份绑定、空间结构、人体运动、相机、时间和多参考冲突。这样实验失败时可以定位控制信号,而不是继续堆提示词。
  • 阅读前要知道:综述中的分类不代表所有方法可在消费级显卡运行;论文演示的可控性和闭源产品能力也不可直接等同。
  • 建议:一致性、镜头控制专题必读;重点看 condition taxonomy 和 universal control。
  • 原文综述 · 配套仓库

2025|Q-VDiT:视频 DiT 的量化与蒸馏

  • 资料身份:ICML 2025 论文;A3 · current-research。
  • 这篇原文具体讲什么:Q-VDiT 研究图像模型的量化方法为何不能直接套用到视频 DiT,并提出针对视频生成注意力和时间特征的量化、蒸馏策略,以降低模型推理成本。论文重点是压缩后如何减少画质与运动质量损失,而不是提出新的内容生成产品。
  • 为什么值得读:对 8GB GPU 用户,它提供了理解低比特、蒸馏、速度和质量折衷的权威入口。仓库里写“支持低显存”时,应该追问压缩对象、精度、测试分辨率和时间长度。
  • 阅读前要知道:研究中的显存和速度数字依赖 GPU、内核、批量、分辨率与帧数;不能直接推算用户机器体验。
  • 建议:本地运行专题按需读;重点看 quantization error analysis、temporal sensitivity 和硬件设置。
  • 原文ICML 论文页

读技术论文时的最低检查

1. 改的是训练目标、主干架构、视频压缩、条件控制,还是推理加速?

2. 质量提升是否同时换了更多数据、更大模型或更高算力?

3. 对比模型是否使用同分辨率、帧数、提示词和采样预算?

4. 一致性来自模型本身,还是固定首帧、参考图、姿态、深度等额外条件?

5. “低显存”是否把大量计算转移到 CPU,或者只生成低分辨率短片?