跳至内容
API价格立即创作

Viggle-Animate 对比 Wan Animate

两者都是替换视频里的角色,也都开源了权重。区别在于各自开跑之前需要什么,以及跑多久。Wan Animate 要一张角色图,外加 pose、面部、遮罩、背景四道预处理。Viggle-Animate 要这段视频和它自己的一帧重绘图——然后 3 次前向推理,而不是 40 次。

一览
Viggle-Animate
更少输入、远更少推理次数、没有绑定环节
  • 同张 B200、同样 124 帧素材:26 秒对 160 秒
  • 3 次前向推理,而不是 40 次
  • 视频推理阶段没有姿态估计、分割、面部追踪或文本编码器
  • 快动作下细节更清晰、姿态跟随更贴
  • 托管版在浏览器里跑,不需要显卡
Wan2.2-Animate-14B
模型更小,对姿态和遮罩有显式控制
  • 17.3B 参数,对比 Viggle-Animate 的 33.1B——本地跑更轻
  • 直接吃一张角色图,不需要重绘帧这一步
  • pose、遮罩、背景是独立、可检查的输入
  • 围绕它已有成熟的 ComfyUI 工作流生态
为什么选择 Viggle-Animate

差异究竟来自哪里

3 次前向推理,而不是 40 次

四个 sigma 边界之间就是三次推理,而且整段 124 帧在一个窗口内跑完。Wan 是 20 步采样,而它的窗口是 77 帧,所以 124 帧要拆成两段串起来——总共 40 次。下面片段里的标签数的是每段的采样步数(4 对 20),表格数的是总推理次数(3 对 40),两者描述的是同两次运行。另外 Viggle-Animate 反而是更大的模型(33.1B 对 17.3B),并不是靠更轻取胜;26 秒是单张 B200 的成绩,你自己的硬件会不同。

一张重绘帧顶替了整个绑定环节

用任意图像编辑器改掉自己素材里的一帧,这一帧就会把角色带过整个镜头。不用提取骨骼、不用修遮罩、不用跟面部追踪较劲。你画成什么样,传播出去就是什么样。

Two inputs enter the model: a driving video and one of its own frames repainted in an image editor. No pose skeleton, segmentation mask, face crop, background plate, depth map or text prompt.

差距最大的地方是快动作

角色替换通常正是在动得快的时候崩。并排渲染里 Wan2.2-Animate-14B 在头部和四肢快速移动时会拖影,而 Viggle-Animate 保住细节,并且对上了站姿宽度、手臂伸展和极限姿态的时间点——而且完全没有姿态输入。

没有骨架,就不假设人形

因为链路里没有任何东西去提取姿态,同一套双输入接口就能处理动物、风格化与插画角色,以及非人形物体——公开案例里最难的是那架客机。而围绕姿态估计搭的流水线,只能走到估计器认得出主体的地方。

对比

并排实测

功能Viggle-AnimateWan Animate
速度与算力
渲染——124 帧 / 24fps / 480×832 / 单张 B20026 秒160 秒,不含其预处理
仅采样耗时13.6 秒140 秒
整段 124 帧的前向推理次数3 次——四个 sigma 边界,中间跑三次40 次——20 步采样,因 124 帧要分两段而跑两轮
单次推理窗口的帧数124 帧,一个窗口内完成每段 77 帧,段间用 1 帧衔接
参数量33.1B——两者中更大的,本地需要更多显存17.3B——消费级硬件上更容易跑
输入与准备
输入驱动视频 + 同一视频里的一张重绘帧驱动视频 + 角色图
视频推理前的预处理pose、面部、遮罩、背景四道,换人模式还要加载 relighting LoRA
是否需要骨骼输入不需要需要
视频推理阶段的辅助模型0 个姿态估计、面部与遮罩模型
视频推理阶段是否需要提示词不需要不需要
输出表现
快动作——甩头、高踢腿、极限伸展保住角色细节,并跟随原始姿态快速肢体附近容易丢细节、出拖影
动作、镜头、节奏与背景的保留
动物、风格化与非人形角色同一套接口,不假设骨架取决于姿态模型能否处理该主体
获取方式
权重开源是,在 Hugging Face是,在 Hugging Face
可在 WanGP 与 ComfyUI 中运行可以可以
官方托管版,无需显卡有,浏览器直接用仅第三方托管
选择适合你的方案

你该选哪一个?

什么情况下选择 Wan Animate

  • 你在消费级显卡上本地跑,17.3B 塞得进显存而 33.1B 塞不进。
  • 你需要把 pose、遮罩、背景当作独立且可检查的输入来显式控制。
  • 你已经有一条基于 Wan 的 ComfyUI 流水线,迁移成本高于省下的渲染时间。
  • 你更愿意直接给模型一张角色图,而不是先重绘一帧。

什么情况下选择 Viggle-Animate

  • 你在反复试,渲染时间是瓶颈——每次 26 秒对 160 秒,迭代起来差距会迅速累积。
  • 你的素材有快动作或极限姿态,那里质量差距最大。
  • 你不想为了换一个角色去维护姿态估计、分割和面部追踪这一整套。
  • 你没有显卡,想直接用托管版而不是本地安装。
  • 你的主体是动物、插画或某种非人形对象,姿态模型对它会很吃力。

常见问题

Viggle-Animate 真的比 Wan Animate 快 6 倍吗?

单次渲染 6.1 倍、只算采样 10.3 倍:同一台机器、同一张 B200、同样的源视频,124 帧 / 24fps / 480×832,26 秒对 160 秒,采样 13.6 秒对 140 秒。那 160 秒还不包含 Wan 的预处理,所以实际差距更大。关于推理次数:Viggle-Animate 是整段 124 帧在一个窗口里跑 3 次,而 Wan 的窗口是 77 帧、采样 20 步,所以 124 帧会拆成两段串行、合计 40 次——这也是为什么对比片段上标的「4 steps」和「20 steps」,和表格里 3 对 40 那一行说的是同两次运行。Viggle-Animate 是两者中更大的模型(33.1B 对 17.3B),所以速度来自 3 次前向推理而不是 40 次,不是因为网络更小。

用 Viggle-Animate 需要显卡吗?

用托管版不需要——在浏览器里跑,你只上传一张角色图。本地使用的话,权重在 Hugging Face,已经能在 WanGP 和社区 ComfyUI 节点里跑。要注意 26 秒是 B200 的基准;消费级显卡会更慢,而且 33.1B 参数比 Wan 的 17.3B 需要更多显存。

Viggle-Animate 像 Wan Animate 一样需要骨骼或遮罩吗?

不需要。重绘帧准备好之后,视频推理阶段不加载任何辅助模型——没有姿态估计、分割、面部追踪或文本编码器。Wan Animate 在采样开始前要先跑 pose、面部、遮罩、背景的预处理。

什么是重绘帧?准备它算不算额外工作?

就是从你自己的驱动视频里取一帧,用图像编辑器把角色改掉——公开的方法里用的是 gpt-image。这是 Wan 没有的一步,也是 Wan 更简单的唯一地方:它直接吃一张角色图。代价交换是:重绘帧把 pose、遮罩、背景的预处理整套去掉了,而且它只是一次图片编辑,不是每段素材都要跑一条流水线。

快动作哪个处理得更好?

Viggle-Animate,而这也是公开对比里差距最大的地方。Wan2.2-Animate-14B 在头部和四肢快速移动时容易丢细节、出拖影,而 Viggle-Animate 角色细节更清晰、也更贴合原始姿态——站姿宽度、手臂伸展、肢体位移和极限姿态的时间点——尽管它没有拿到任何骨骼输入。

两个模型都开源吗?

两者都在 Hugging Face 发布了开源权重,也都能在 WanGP 和 ComfyUI 里跑。获取方式上的区别在托管:Viggle 有官方托管版,不用本地安装就能用;Wan Animate 只有第三方托管。

什么情况下该选 Wan Animate?

当你本地跑、17.3B 塞得进显存而 33.1B 塞不进时;当你需要把 pose、遮罩、背景当作可检查、可覆盖的独立输入时;或者你已经有一条基于 Wan 的 ComfyUI 流水线,迁移成本高于省下的渲染时间时。

可以免费试吗?

权重可以免费下载自己跑。托管版可以免费试用,用量大之后走付费方案——当前档位见定价页。

别错过!

订阅邮件,第一时间了解最新功能、专属优惠和 Viggle 精选内容。

© 2026 Viggle. 保留所有权利。