2022-04-10 / Research
Video Diffusion Models: Motion Enters Diffusion
A note on why video generation first had to become a problem of time, not image quality.
- video generation
- diffusion
- temporal coherence
Question
读完 Video Diffusion Models 后,真正要记住的不是“扩散模型也能做视频”,而是:视频生成的第一性问题不是画得更清楚,而是在时间里维持同一个世界。
这篇论文把图像扩散模型扩展到视频,并尝试用图像和视频联合训练。这个选择在当时很关键。公开视频数据少、质量不齐、caption 弱,而图像数据已经足够大。联合训练等于承认一件事:模型可以先从图像里学外观密度,再从视频里学状态变化。视频不是完全独立的新任务,它从图像生成里借来语义和质感,然后补上时间。
Technical Reading
论文里有两个判断值得后来看视频模型时反复使用。
第一,视频模型需要同时解决 spatial extension 和 temporal extension。空间扩展是画面变大、分辨率提高、内容更完整;时间扩展是动作延长、物体持续、镜头前后状态一致。很多早期样片看起来失败,并不是因为某一帧难看,而是时间扩展失败:角色的手变了,道具消失了,背景像另一个房间。
第二,条件采样让“从一个视觉状态继续生成”成为可能。后来的 image-to-video、first-last-frame、reference-to-video,本质上都在围绕这个问题发展:不要每次从空白 prompt 重新创造世界,而是让模型在已有状态上继续推演。
Capability Boundary
这篇论文还没有解决真正的导演问题。它能证明视频扩散可行,但不能保证角色意图、动作因果、镜头语言或多镜头连续性。它更像是把门打开:证明扩散模型可以在时间轴上工作,但同时暴露出视频比图像多出的所有麻烦。
所以这不是一个“工具节点”,而是一个“问题定义节点”。
Lab Judgment
如果把这篇论文转成后来的创作方法,最重要的提醒是:
prompt 不能只写主体和风格。
它必须写状态如何变化,以及哪些状态不能变化。
一个镜头里,角色、道具、空间、光线和动作后果都是状态。视频生成不是让画面动起来,而是让状态有时间顺序。这个判断会一直延伸到 Sora 的 world simulator、Veo 的 cinematography prompt、Seedance 的 multi-shot,以及 Kling 的 storyboard control。