Unbow
English·中文

文字没有被参考图替代

参考图锁住可见事实,文字负责说明这一镜为什么存在、什么能变、什么不能变。

返回 Lab

问题

参考图越来越好用以后,提示词是不是可以少写,甚至不写?

我的判断是:可以少写表面描述,但不能少写判断。

参考图能告诉模型人物、房间、光线和物件长什么样。它不能自动说明门缝为什么重要,手机为什么不能换位置,某个动作为什么只能停在发现之前。看得见的东西由图承担;看不见的取舍仍然要由文字承担。

观察

很多失败不是画面难看,而是画面离开了故事。

房间还很紧张,但入口方向变了。人物脸还像,但动作提前完成了。道具还在画面里,却不再是上一镜那个道具。模型保住了气氛,却丢了因果。

所以 Reference Pack 不能只是情绪板。情绪板回答“像什么”,Reference Pack 回答“什么不能变”。

原则

我会把工作拆成三层:

语义层:这一镜要保护什么判断
Reference Pack:哪些可见事实需要被继承
Shot Block:当前几秒钟具体交给模型做什么

语义层先写清楚故事压力。Reference Pack 再把它变成可见事实。Shot Block 最后只选择当前镜头需要执行的部分。

这三层不能混。把 Reference Pack 当成提示词,会让图片承担太多解释工作。把 Shot Block 写成剧情摘要,会让模型重新导演整场戏。

测试句

一个有效的镜头请求应该能回答:

这一镜从什么状态开始?
哪个物件不能消失?
哪个动作不能提前完成?
镜头结束时要留下什么?

如果这些问题答不出来,参考图再好也只是参考图。

边界

参考图没有让文字层消失。它只是让文字层更少写外观,更多写判断。