2026-06-18 / Reference
文字没有被参考图替代
参考图锁住可见事实,文字负责说明这一镜为什么存在、什么能变、什么不能变。
返回 Lab
问题
参考图越来越好用以后,提示词是不是可以少写,甚至不写?
我的判断是:可以少写表面描述,但不能少写判断。
参考图能告诉模型人物、房间、光线和物件长什么样。它不能自动说明门缝为什么重要,手机为什么不能换位置,某个动作为什么只能停在发现之前。看得见的东西由图承担;看不见的取舍仍然要由文字承担。
观察
很多失败不是画面难看,而是画面离开了故事。
房间还很紧张,但入口方向变了。人物脸还像,但动作提前完成了。道具还在画面里,却不再是上一镜那个道具。模型保住了气氛,却丢了因果。
所以 Reference Pack 不能只是情绪板。情绪板回答“像什么”,Reference Pack 回答“什么不能变”。
原则
我会把工作拆成三层:
语义层:这一镜要保护什么判断
Reference Pack:哪些可见事实需要被继承
Shot Block:当前几秒钟具体交给模型做什么
语义层先写清楚故事压力。Reference Pack 再把它变成可见事实。Shot Block 最后只选择当前镜头需要执行的部分。
这三层不能混。把 Reference Pack 当成提示词,会让图片承担太多解释工作。把 Shot Block 写成剧情摘要,会让模型重新导演整场戏。
测试句
一个有效的镜头请求应该能回答:
这一镜从什么状态开始?
哪个物件不能消失?
哪个动作不能提前完成?
镜头结束时要留下什么?
如果这些问题答不出来,参考图再好也只是参考图。
边界
参考图没有让文字层消失。它只是让文字层更少写外观,更多写判断。