2022-06-02 / Research
CogVideo: Inheriting Image Models for Motion
A note on the early strategy of borrowing image-model semantics before learning motion.
- CogVideo
- transformer
- open models
Question
CogVideo 的历史位置,不是它一下子解决了视频生成,而是它让一个早期现实变得很清楚:视频模型很难从零学会一切,所以它必须先继承图像模型。
论文使用 9B 参数 Transformer,并从 CogView2 这样的文本到图像模型继承知识。这个选择不是偷懒,而是当时最务实的路线。文本到图像已经学会了大量视觉概念、语言对齐、材质、主体和构图;视频模型真正稀缺的是运动数据和时间建模。把已有图像知识迁移过来,可以把训练重心转移到“如何让这些视觉概念在时间里变化”。
Technical Reading
CogVideo 的多帧率分层训练值得注意。不同 frame rate 对应不同时间尺度:有的描述短动作,有的描述较慢的场景变化。视频不是一个统一速度的对象。人转头、云移动、镜头推进、光线变化,它们各自有时间尺度。
这个判断后来在多镜头生成里会变得更重要。一个模型如果只能处理短时间局部运动,就容易在角色动作上还可以、但在场景延续上失败;如果只学长程变化,又可能牺牲手部、脸部和物体交互。早期分层训练的价值,是让“时间尺度”进入了视频模型设计。
Capability Boundary
CogVideo 的局限也正来自它的继承路径。它能继承图像语义,但运动更像附加在图像能力上的层。也就是说,它容易先生成一个像样的视觉世界,再让世界发生某种变化;但它未必真的理解动作为什么发生、动作改变了什么、下一帧应该继承什么。
这解释了早期视频生成常见的感觉:首帧好看,后面像在漂。
Lab Judgment
我会把 CogVideo 记成“图像模型时代的视频生成”。它留下的工作方法是:
如果模型强在视觉概念,就用视觉锚点稳定身份。
如果模型弱在时间推理,就把动作拆短,并明确开始状态和结束状态。
这不是过时经验。很多今天的模型在复杂动作上仍会退回图像模型习惯:先给你一个漂亮画面,再试图让它动。判断一个视频模型是否真正进步,就看它是否能让运动改变世界,而不是只让画面出现运动感。