Unbow
English·中文

多主体场景的空间连续性

多人室内镜头先保护空间,再决定谁成为单一清晰主视觉。

关于多主体、空间连续性、声音边界和提示词一致性检查的工作记录。

  • AI 视频
  • 多主体
  • 空间连续性
  • 生成控制
A multi-subject interior continuity reference with room and subject priority

任务

多人场景不等于每个人都要清楚露脸。

短剧镜头通常只需要一个更窄的目标:同一个房间还在,当前视觉重点清楚,其他人用足够的方式证明关系。所有人物都抢成正脸时,房间会漂移,道具会重置,反应会变成新主体。

约束

难点不是人数,而是记忆。

房间有方向,人物有位置,道具有状态,声音可能来自画外。下一镜还要继承其中一部分。如果提示词同时要求所有人、所有脸、所有动作和所有空间事实,控制力反而会下降。

做法

1. 先让空间有记忆

在分配人物之前,先锁住反复出现的锚点:

入口方向
主要行动区域
固定家具
重复出现的道具
声音来源
下一镜承接点

空间连续性成立后,当前镜头只盯住一个人,也不会像换了房间。

2. 每个镜头只保留一个单一清晰主视觉

这一镜最重要的是说话人、手上的物件、沉默反应,还是门口压力?先选一个。

其他人可以是肩背、手部、浅景深轮廓、门外声音或被压低的反应。他们仍然在场,但不跟主视觉争抢模型资源。

3. 拆分后检查承接

镜头批次拆开以后,一定要做一致性检查:

房间锚点还在吗
主视觉是不是只有一个
声音来源有没有被拍错
道具状态有没有接上
下一批能不能继承当前尾部

检查的对象不是文采,而是可执行性。

产物

Room blocking frame 多人关系先靠房间方向和站位成立,再决定谁承担当前镜头。

Threshold pressure frame 门、影子、声音和反应都可以承担存在感,不必每次都变成清晰正脸。

最后形成的规则很轻:保护空间,选出主视觉,降低不必要的露脸需求,再检查批次承接。

复盘

多主体控制常常是减法。

少让模型猜一张脸,就少一个漂移源。多人镜头稳定,不是因为每个人都最清楚,而是因为每个人在这一镜里的职责刚好够用。