method / 2026
多主体场景的空间连续性
多人室内镜头先保护空间,再决定谁成为单一清晰主视觉。
关于多主体、空间连续性、声音边界和提示词一致性检查的工作记录。
- AI 视频
- 多主体
- 空间连续性
- 生成控制

任务
多人场景不等于每个人都要清楚露脸。
短剧镜头通常只需要一个更窄的目标:同一个房间还在,当前视觉重点清楚,其他人用足够的方式证明关系。所有人物都抢成正脸时,房间会漂移,道具会重置,反应会变成新主体。
约束
难点不是人数,而是记忆。
房间有方向,人物有位置,道具有状态,声音可能来自画外。下一镜还要继承其中一部分。如果提示词同时要求所有人、所有脸、所有动作和所有空间事实,控制力反而会下降。
做法
1. 先让空间有记忆
在分配人物之前,先锁住反复出现的锚点:
入口方向
主要行动区域
固定家具
重复出现的道具
声音来源
下一镜承接点
空间连续性成立后,当前镜头只盯住一个人,也不会像换了房间。
2. 每个镜头只保留一个单一清晰主视觉
这一镜最重要的是说话人、手上的物件、沉默反应,还是门口压力?先选一个。
其他人可以是肩背、手部、浅景深轮廓、门外声音或被压低的反应。他们仍然在场,但不跟主视觉争抢模型资源。
3. 拆分后检查承接
镜头批次拆开以后,一定要做一致性检查:
房间锚点还在吗
主视觉是不是只有一个
声音来源有没有被拍错
道具状态有没有接上
下一批能不能继承当前尾部
检查的对象不是文采,而是可执行性。
产物
多人关系先靠房间方向和站位成立,再决定谁承担当前镜头。
门、影子、声音和反应都可以承担存在感,不必每次都变成清晰正脸。
最后形成的规则很轻:保护空间,选出主视觉,降低不必要的露脸需求,再检查批次承接。
复盘
多主体控制常常是减法。
少让模型猜一张脸,就少一个漂移源。多人镜头稳定,不是因为每个人都最清楚,而是因为每个人在这一镜里的职责刚好够用。