2024-12-19 / AI
Veo 2: Cinematography Becomes Promptable
A note on why Veo 2's real shift was camera behavior, physics, and film grammar.
- Veo
- Veo 2
- cinematography
Question
Veo 2 发布后,最值得记录的不是“Google 也有强视频模型”,而是电影语言开始成为明确的模型接口。
Veo 在 2024 年 5 月已经强调 1080p、超过一分钟、自然语言理解和 cinematic terms。到 Veo 2,Google 更明确写出 improved realism、physics、human movement、expression、cinematography、lens、effects、4K 和分钟级长度。这些词放在一起,说明模型评估不再只是画质,而是摄影行为。
Technical Reading
cinematography prompt 和普通视觉 prompt 的区别很大。
visual prompt: mountain valley, warrior, mist, sunset
camera prompt: slow push-in, low-angle tracking, 35mm lens, shallow depth of field
前者告诉模型画什么,后者告诉模型怎样看。视频模型如果能理解镜头语言,它就不只是生成主体,而是生成观看关系:谁被强调,空间如何展开,情绪如何通过距离和运动变化。
Veo 2 对物理和人体运动的强调,也说明模型开始补足 Sora 之后大家最在意的边界:画面宏大不够,动作要可信。人物表情、肢体、接触、重力、惯性和镜头运动,都会决定一个片段能不能被当成镜头。
Capability Boundary
Veo 2 仍然不能只靠一段华丽 prompt 解决叙事。电影语言可以控制单镜头,但跨镜头连续性仍然需要 reference、角色资产、分镜表和人工筛选。一个模型懂 lens,不代表它懂剧情。
所以 Veo 2 的位置更像是把 single shot 的导演语言往前推进,而不是直接完成 multi-shot production。
Lab Judgment
我会把 Veo 2 之后的提示词写成四层,而不是一段形容词:
subject: 谁在镜头里
space: 他处在什么空间关系里
camera: 镜头距离、焦段、机位、运动方式
event: 动作如何开始、如何结束、留下什么状态
这套结构比堆 cinematic、high quality、dramatic 更有用。Veo 2 的关键不是让画面更像电影,而是让“摄影机做什么”成为可操作变量。