Viggle-Animate 对比 Wan Animate
两者都是替换视频里的角色,也都开源了权重。区别在于各自开跑之前需要什么,以及跑多久。Wan Animate 要一张角色图,外加 pose、面部、遮罩、背景四道预处理。Viggle-Animate 要这段视频和它自己的一帧重绘图——然后 3 次前向推理,而不是 40 次。
- 同张 B200、同样 124 帧素材:26 秒对 160 秒
- 3 次前向推理,而不是 40 次
- 视频推理阶段没有姿态估计、分割、面部追踪或文本编码器
- 快动作下细节更清晰、姿态跟随更贴
- 托管版在浏览器里跑,不需要显卡
- 17.3B 参数,对比 Viggle-Animate 的 33.1B——本地跑更轻
- 直接吃一张角色图,不需要重绘帧这一步
- pose、遮罩、背景是独立、可检查的输入
- 围绕它已有成熟的 ComfyUI 工作流生态
差异究竟来自哪里
3 次前向推理,而不是 40 次
四个 sigma 边界之间就是三次推理,而且整段 124 帧在一个窗口内跑完。Wan 是 20 步采样,而它的窗口是 77 帧,所以 124 帧要拆成两段串起来——总共 40 次。下面片段里的标签数的是每段的采样步数(4 对 20),表格数的是总推理次数(3 对 40),两者描述的是同两次运行。另外 Viggle-Animate 反而是更大的模型(33.1B 对 17.3B),并不是靠更轻取胜;26 秒是单张 B200 的成绩,你自己的硬件会不同。
一张重绘帧顶替了整个绑定环节
用任意图像编辑器改掉自己素材里的一帧,这一帧就会把角色带过整个镜头。不用提取骨骼、不用修遮罩、不用跟面部追踪较劲。你画成什么样,传播出去就是什么样。

差距最大的地方是快动作
角色替换通常正是在动得快的时候崩。并排渲染里 Wan2.2-Animate-14B 在头部和四肢快速移动时会拖影,而 Viggle-Animate 保住细节,并且对上了站姿宽度、手臂伸展和极限姿态的时间点——而且完全没有姿态输入。
没有骨架,就不假设人形
因为链路里没有任何东西去提取姿态,同一套双输入接口就能处理动物、风格化与插画角色,以及非人形物体——公开案例里最难的是那架客机。而围绕姿态估计搭的流水线,只能走到估计器认得出主体的地方。
并排实测
| 功能 | Viggle-Animate | Wan Animate |
|---|---|---|
| 速度与算力 | ||
| 渲染——124 帧 / 24fps / 480×832 / 单张 B200 | 26 秒 | 160 秒,不含其预处理 |
| 仅采样耗时 | 13.6 秒 | 140 秒 |
| 整段 124 帧的前向推理次数 | 3 次——四个 sigma 边界,中间跑三次 | 40 次——20 步采样,因 124 帧要分两段而跑两轮 |
| 单次推理窗口的帧数 | 124 帧,一个窗口内完成 | 每段 77 帧,段间用 1 帧衔接 |
| 参数量 | 33.1B——两者中更大的,本地需要更多显存 | 17.3B——消费级硬件上更容易跑 |
| 输入与准备 | ||
| 输入 | 驱动视频 + 同一视频里的一张重绘帧 | 驱动视频 + 角色图 |
| 视频推理前的预处理 | 无 | pose、面部、遮罩、背景四道,换人模式还要加载 relighting LoRA |
| 是否需要骨骼输入 | 不需要 | 需要 |
| 视频推理阶段的辅助模型 | 0 个 | 姿态估计、面部与遮罩模型 |
| 视频推理阶段是否需要提示词 | 不需要 | 不需要 |
| 输出表现 | ||
| 快动作——甩头、高踢腿、极限伸展 | 保住角色细节,并跟随原始姿态 | 快速肢体附近容易丢细节、出拖影 |
| 动作、镜头、节奏与背景的保留 | 是 | 是 |
| 动物、风格化与非人形角色 | 同一套接口,不假设骨架 | 取决于姿态模型能否处理该主体 |
| 获取方式 | ||
| 权重开源 | 是,在 Hugging Face | 是,在 Hugging Face |
| 可在 WanGP 与 ComfyUI 中运行 | 可以 | 可以 |
| 官方托管版,无需显卡 | 有,浏览器直接用 | 仅第三方托管 |
你该选哪一个?
什么情况下选择 Wan Animate
- 你在消费级显卡上本地跑,17.3B 塞得进显存而 33.1B 塞不进。
- 你需要把 pose、遮罩、背景当作独立且可检查的输入来显式控制。
- 你已经有一条基于 Wan 的 ComfyUI 流水线,迁移成本高于省下的渲染时间。
- 你更愿意直接给模型一张角色图,而不是先重绘一帧。
什么情况下选择 Viggle-Animate
- 你在反复试,渲染时间是瓶颈——每次 26 秒对 160 秒,迭代起来差距会迅速累积。
- 你的素材有快动作或极限姿态,那里质量差距最大。
- 你不想为了换一个角色去维护姿态估计、分割和面部追踪这一整套。
- 你没有显卡,想直接用托管版而不是本地安装。
- 你的主体是动物、插画或某种非人形对象,姿态模型对它会很吃力。
常见问题
Viggle-Animate 真的比 Wan Animate 快 6 倍吗?
单次渲染 6.1 倍、只算采样 10.3 倍:同一台机器、同一张 B200、同样的源视频,124 帧 / 24fps / 480×832,26 秒对 160 秒,采样 13.6 秒对 140 秒。那 160 秒还不包含 Wan 的预处理,所以实际差距更大。关于推理次数:Viggle-Animate 是整段 124 帧在一个窗口里跑 3 次,而 Wan 的窗口是 77 帧、采样 20 步,所以 124 帧会拆成两段串行、合计 40 次——这也是为什么对比片段上标的「4 steps」和「20 steps」,和表格里 3 对 40 那一行说的是同两次运行。Viggle-Animate 是两者中更大的模型(33.1B 对 17.3B),所以速度来自 3 次前向推理而不是 40 次,不是因为网络更小。
用 Viggle-Animate 需要显卡吗?
用托管版不需要——在浏览器里跑,你只上传一张角色图。本地使用的话,权重在 Hugging Face,已经能在 WanGP 和社区 ComfyUI 节点里跑。要注意 26 秒是 B200 的基准;消费级显卡会更慢,而且 33.1B 参数比 Wan 的 17.3B 需要更多显存。
Viggle-Animate 像 Wan Animate 一样需要骨骼或遮罩吗?
不需要。重绘帧准备好之后,视频推理阶段不加载任何辅助模型——没有姿态估计、分割、面部追踪或文本编码器。Wan Animate 在采样开始前要先跑 pose、面部、遮罩、背景的预处理。
什么是重绘帧?准备它算不算额外工作?
就是从你自己的驱动视频里取一帧,用图像编辑器把角色改掉——公开的方法里用的是 gpt-image。这是 Wan 没有的一步,也是 Wan 更简单的唯一地方:它直接吃一张角色图。代价交换是:重绘帧把 pose、遮罩、背景的预处理整套去掉了,而且它只是一次图片编辑,不是每段素材都要跑一条流水线。
快动作哪个处理得更好?
Viggle-Animate,而这也是公开对比里差距最大的地方。Wan2.2-Animate-14B 在头部和四肢快速移动时容易丢细节、出拖影,而 Viggle-Animate 角色细节更清晰、也更贴合原始姿态——站姿宽度、手臂伸展、肢体位移和极限姿态的时间点——尽管它没有拿到任何骨骼输入。
两个模型都开源吗?
两者都在 Hugging Face 发布了开源权重,也都能在 WanGP 和 ComfyUI 里跑。获取方式上的区别在托管:Viggle 有官方托管版,不用本地安装就能用;Wan Animate 只有第三方托管。
什么情况下该选 Wan Animate?
当你本地跑、17.3B 塞得进显存而 33.1B 塞不进时;当你需要把 pose、遮罩、背景当作可检查、可覆盖的独立输入时;或者你已经有一条基于 Wan 的 ComfyUI 流水线,迁移成本高于省下的渲染时间时。
可以免费试吗?
权重可以免费下载自己跑。托管版可以免费试用,用量大之后走付费方案——当前档位见定价页。
拿你自己的素材试一次,自己比对结果。
开始一次渲染


