Unbow
English·中文

Make-A-Video: Learning Motion Without Paired Captions

A note on the data problem behind early text-to-video generation.

  • Make-A-Video
  • data
  • motion
Back to Lab

Question

Make-A-Video 最值得研究的地方,是它没有把视频生成看成一个单一数据问题。它把数据拆开:图像文本对负责学习“世界长什么样”,无标注视频负责学习“世界如何运动”。

这个拆分解决了当时最现实的瓶颈:高质量文本视频对太少。如果等待足够多、足够干净、足够细的 captioned video,文本到视频会被数据拖住。Make-A-Video 的路线是先从图像 caption 学语义,再从视频里学动态变化,把 appearance 和 motion 拆成两种知识。

Technical Reading

这件事对后来的视频模型训练非常关键。它说明 caption 不只是给视频贴标签,而是决定模型把哪些东西当成可控变量。

如果 caption 只写 “a woman walks in a room”,模型学到的是主体和动作类型;如果 caption 写出镜头移动、动作方向、空间关系、光线变化、物体是否被拿起,模型才有机会把这些东西作为生成控制面。Seedance 1.0 技术报告后来强调细粒度 caption、shot boundary、camera motion 和 scene static information,本质上延续的是同一个问题:视频数据必须被描述到足够能教会模型控制。

Capability Boundary

Make-A-Video 的策略让文本到视频跨过了数据稀缺,但它也留下一个问题:分开学到的 appearance 和 motion,不一定天然能组合成稳定事件。模型可能知道一个人是什么样,也知道“走路”是什么样,但不知道这个人在特定空间里走过桌边后,桌子、衣服、光线和身体遮挡关系应该怎样持续。

也就是说,它能让视频出现,但还不等于让视频成为可剪辑镜头。

Lab Judgment

这篇之后,写 prompt 就不能再把动态词当点缀。更好的写法是把信息分层:

appearance: 人、衣服、场景、材质、光线
motion: 动作方向、速度、镜头运动、环境变化
state: 动作结束后什么必须保持一致

Make-A-Video 让人意识到:视频模型的训练是分层的,创作提示词也应该分层。把所有词塞进一句气氛描述,只会把模型重新推回图像生成习惯。

Sources