Unbow
English·中文

Sora: The World-Simulator Frame

A note on why Sora changed the question from clip generation to visual state simulation.

  • Sora
  • world model
  • OpenAI
Back to Lab

Question

Sora 发布后,最值得认真看的不是一分钟视频本身,而是 OpenAI 把它称为 world simulator 的方式。这个说法有风险,也有启发。风险是它容易被理解成模型已经懂世界;启发是它把视频生成的评价维度从“画面能动”推到了“状态能否持续”。

技术报告把 Sora 描述为在视频和图像上联合训练的 diffusion transformer,把视觉数据切成 spacetime patches,并支持不同 duration、resolution、aspect ratio。这个统一表示很关键:模型不再只面对固定格式的视频片段,而是在一个更大的视觉状态空间里学习。

Technical Reading

Sora 的 spacetime patches 让我重新理解“镜头”。一个镜头可以被看作一组时间里的视觉 token,但创作上它不是 token 序列,而是状态变化序列。角色、空间、道具、光线、摄影机位置,每一项都必须在时间里被维护。

报告里提到的 3D consistency、object permanence、long-range dependencies、多镜头同角色,正是视频生成最难的部分。它们不是附加功能,而是短剧、广告和叙事视频能否成立的底层条件。

Capability Boundary

Sora 也让人更清楚地看到边界。一个模型可以生成看似复杂的物理场景,但仍然在因果、接触、数量、左右关系和动作结果上出错。它可能在镜头里表现出“像世界”的统计规律,但还不能被当成可控的物理模拟器。

所以 world simulator 这个词不能被当成结论。它更像一个研究方向:如果模型规模、数据表示和训练目标继续推进,视频模型可能逐渐学会维护世界状态。

Lab Judgment

发布几天后我会保留一个谨慎判断:Sora 让 AI 视频从 prompt art 进入 state management。

old prompt problem: 这个画面里有什么?
new prompt problem: 什么必须在时间里保持,什么可以变化?

这会改变写分镜的方式。分镜不只是 shot list,而是状态传递表:

Shot 1 leaves: character angry, letter hidden, lamp broken
Shot 2 must inherit: same letter, same injury, same room direction

Sora 的真正影响,不是让每个人立刻拥有电影模型,而是迫使我们把“连续性”当成生成的核心对象。

Sources