Unbow
English·中文

HunyuanVideo and Wan: Open Models Become Infrastructure

A note on open video stacks, first-last-frame control, and why inspectability matters.

  • HunyuanVideo
  • Wan
  • open source
Back to Lab

Question

HunyuanVideo 和 Wan2.1 放在一起看,重点不是谁的样片更好,而是开放视频模型开始变成基础设施。

HunyuanVideo 的论文强调数据整理、架构、扩展训练、训练和推理基础设施,并公开代码。Wan2.1 的仓库则把 T2V、I2V、video editing、T2I、video-to-audio、3D causal VAE、first-last-frame control 等能力放进一个开放生态。它们让视频生成不再只能通过闭源平台体验,而可以被部署、拆解、加速、改造。

Technical Reading

Wan2.1 的 first-last-frame 特别值得写进 Lab。它把视频生成从“从一个状态出发”推进到“在两个状态之间生成过渡”。这对分镜非常重要,因为分镜本来就是状态设计:

first frame: 角色站在门外,手里拿着信
last frame: 角色进入房间,信被放在桌上

模型要做的不是自由想象,而是补出符合逻辑的中间运动。这个控制面比单纯 image-to-video 更接近剪辑需求。

HunyuanVideo 的价值则在另一个层面:它把大模型训练过程公开到足够能讨论。开放论文和仓库让人看到数据、架构和推理系统如何共同决定视频质量。

Capability Boundary

开放模型仍会在画质、速度、长程一致性和复杂角色交互上落后于部分闭源模型。但开放模型能提供一个更可靠的研究基线。闭源模型给结果,开放模型给结构。

当一个创作者或开发者需要判断“到底是哪一层失败”,开放模型更有价值:是 VAE 压缩问题、caption 问题、prompt 问题、运动建模问题,还是采样和推理设置问题?

Lab Judgment

我会用开放视频模型建立测试骨架:

same reference image
same first and last frame
same prompt
same failure categories
same scoring notes

闭源模型适合追求最高可用结果,开放模型适合理解为什么失败。长期看,两者都需要:一个推动生产,一个训练判断力。

Sources