Unbow
English·中文

Imagen Video and Phenaki: Fidelity or Time

A note on the early split between sharper video and longer narrative continuity.

  • Imagen Video
  • Phenaki
  • Google Research
Back to Lab

Question

Imagen Video 和 Phenaki 放在一起看,像是 2022 年视频生成的一次分叉:一条路追求更高清、更稳定、更像视频;另一条路追求更长、更能跟随事件序列。

Imagen Video 使用级联视频扩散模型,把低分辨率视频逐步提升到更高清、更高帧率。它关心的是 fidelity:细节、分辨率、帧率、画面质量、整体可看性。Phenaki 则更激进地面对时间问题。它用 prompt sequence 条件生成可变长度视频,目标不是只响应一句提示,而是跟随一组事件继续展开。

Technical Reading

这两个方向后来都没有消失。

高清路线把视频生成推向商业可用:更高分辨率、更少噪声、更好的材质和光线。没有这层,模型只能做研究样片。长时序路线把视频生成推向叙事:角色如何穿过事件,场景如何变化,提示词如何像分镜一样组织。

它们的冲突在于算力和建模重心。越追求 fidelity,越容易把资源花在单段画质;越追求 long-form continuity,越要面对角色、空间、动作因果和提示序列之间的关系。

Capability Boundary

当时的答案还不完整。Imagen Video 可以让短片段更像高质量视频,但不等于能管理剧情。Phenaki 可以让 prompt sequence 推动长视频,但画面质量和细节控制又没有完全跟上。这个分叉其实给后来所有模型定了评价维度:

fidelity: 单个镜头是否成立
time: 多个事件是否持续
control: 创作者能否指定变化方式

只看一个维度,会误判模型。

Lab Judgment

这组节点让我形成一个评价习惯:不要问“哪个模型更好”,先问它强在哪个时间尺度。

single frame: 美术、构图、材质
single shot: 动作、镜头、短程一致性
shot sequence: 角色、空间、事件、转场
story span: 叙事记忆、节奏、因果

视频生成的历史不是直线升级,而是这些时间尺度不断被补齐。真正有生产价值的模型,必须至少在 single shot 和 shot sequence 两层站稳。

Sources