Unbow
English·中文

Kling 3.0: Reference, Audio, and Storyboard Control

A note on Kling 3.0 as a shift from isolated clips toward reference-driven sequence control.

  • Kling
  • storyboard
  • reference control
Back to Lab

Question

Kling 3.0 的发布重点,不是又一个更强视频模型,而是它把 reference、native audio、multi-shot storytelling 和 storyboard 放到同一个产品叙事里。

官方发布提到 Video 3.0、Video 3.0 Omni、Image 3.0、Image 3.0 Omni,并强调 15 秒、原生音频、多语言和方言、参考视频和多图参考、in-video editing、storyboard feature。这里最值得注意的是控制面组合:模型不只接受文本,还开始接受角色、物体、声音、分镜和已有片段作为约束。

Product Reading

Kling 3.0 把视频生成的单位从 clip 推向 sequence。

单个 clip 的问题是:它可以漂亮,但不一定能接。sequence 的问题是:角色、空间、声音、道具和动作后果必须跨镜头持续。reference control 试图稳定角色和物体,storyboard control 试图稳定镜头顺序,native audio 试图让声音不再是后期附加层。

这三者结合后,提示词开始像导演调度:

reference: same character and costume
storyboard: three shots, wide to medium to close-up
audio: room tone, paper rustle, restrained dialogue
edit: preserve object position across shots

Capability Boundary

Kling 3.0 的真正边界,要看 reference 是否能跨场景保持,而不是看一条样片里人物是否好看。参考视频和多图可以提升一致性,但也可能让模型过度贴近参考,牺牲新动作和新场景里的自然性。

multi-shot storytelling 也需要测试:是模型真的理解镜头关系,还是只是把多个短片段拼在一起?如果角色在第二镜头丢失道具,或声音和动作节奏错位,那么 sequence 仍然没有成立。

Lab Judgment

我会用 Kling 3.0 测这些任务:

Shot 1: wide shot, character enters the library.
Shot 2: medium shot, same character opens a metal box.
Shot 3: close-up, same hand removes a folded letter.
Audio: low room tone, paper rustle, one short line of dialogue.
Continuity: costume, box, letter, screen direction.

Kling 的意义不是“人人都能做导演”这句口号,而是它把导演控制拆成可测试的输入:参考、分镜、声音、编辑。下一步要看的,是这些输入能否真正约束输出。

Sources