workflow / 2026
从导演契约到镜头批次
把场景意图整理成小的执行单元,而不是把提示词写成第二版剧本。
关于导演契约、屏幕信息、画外声和镜头批次如何进入 AI 视频生成层的工作记录。
- AI 视频
- 镜头批次
- 导演契约
- 生产链路

任务
提示词不是剧本。它不应该把整场戏重新讲一遍。
它只需要交付模型能执行的部分:画面里有什么,声音从哪里来,上一镜留下了什么,当前镜头结束时必须保留什么。如果把动机、背景和后续结果全塞进提示词,模型就会被迫同时写戏、调度和记忆,结果通常更不稳定。
这一页记录的是:怎样把导演意图编译成镜头批次。
约束
由手机或屏幕信息推动的场景很容易失控。
关键信息可能来自手机亮屏、震动、画外声、沉默反应,或者一个必须留在原处的道具。屏幕信息和声音来源一旦混在一起,模型就可能制造错误口型、把手机移动到别处,或者让本来不该出现的人进入画面。
做法
1. 把导演契约放在提示词之前
导演契约先写清楚本场不能漂移的边界:
开场画面
房间状态
手机或屏幕状态
声音来源
结束压力
模型不能自行补完的内容
后面的镜头批次只在这个边界里执行。
2. 拆开屏幕信息和画外声
屏幕信息是可见的:冷光、界面状态、手的位置、人物低头确认。
画外声是听见的:它可以推动角色反应,但不应该强迫画面里的主体开口。这个拆分可以保护口型、主体优先级和道具连续性。
3. 每个戏剧拍点只生成一个小批次
镜头批次只承担当前几秒:
起始状态
可见主体
空间和道具状态
镜头动作
声音位置
结束状态
承接风险
上游已经做过取舍,提示词就不用变成长散文。
产物
先稳定房间、主体位置和道具压力,再让模型处理表演。
屏幕状态和声音来源是两条约束,混在一起就容易产生漂移。
最后留下的是一套复查方式:这一批是否接住了上一批,是否给下一批留下了明确状态,声音来源是否清楚,屏幕信息是否被视觉化,而不是被写成对白。
复盘
提示词越像编译结果,越不容易变成失控的第二版剧本。
剧本和导演判断留在上游。镜头批次只负责把当前镜头交给模型。