从静到动的两条路线

ComfyUI 做出图玩熟了,下一步自然是让画面动起来。现在主流两条路线:一是直接文生视频,用 Wan 这类专门的视频扩散模型,一句提示词出几秒动态片段;二是AnimateDiff,把你已经调好的 Stable Diffusion 静态工作流,外挂一个运动模块,让原本的图动起来。前者质量高、显存吃紧,后者复用现有工作流、轻量灵活。

路线一:Wan 视频模型

Wan(万相)是阿里开源的视频生成模型,在 ComfyUI 生态里有对应的官方节点。它的特点是直接生成视频,不是图生视频,动态幅度和连贯性比早期模型好不少。工作流大致是:加载 Wan 的 text-to-video 模型节点 → 正反提示词 → 设定帧数(比如 81 帧,约 5 秒@16fps)和分辨率 → 采样 → VAE 解码输出视频帧 → 用 Video Combine 节点合成 MP4。

关键在显存账:视频模型比图像模型大一个量级,Wan 1.3B 级别的量化版可以在 12-16GB 显存跑短片,完整 14B 级别则要 24GB 以上。帧数越多、分辨率越高,latent 空间的计算量按帧数涨——这是「能出图却出不了视频」的核心原因。

路线二:AnimateDiff 复用 SD 工作流

如果你已经有一套调得很满意的 SD/SDXL 出图工作流,AnimateDiff 的价值是最小改动让它动起来:在 KSampler 之前插一个 AnimateDiff Loader 节点,加载对应的运动模块(mm_sd_v15_v2 之类),再在采样后接一个帧合成节点。你原本调好的提示词、LoRA、采样参数几乎不用动,只是输出从「一张图」变成「一小段动图」。

路线适合显存动效质量
Wan 文生视频要直接出成片较高(16GB+)连贯、幅度大
AnimateDiff复用现有 SD 工作流中(可沿用原配置)小幅运动、风格统一

三个实操要点

第一,帧数别贪多:新手先跑 16-24 帧的短片段验证流程,跑通了再加长——视频生成慢,一上来就 81 帧,等半天失败很打击人。第二,提示词写「运动」而非只写「物体」:静态图提示词描述长相,视频提示词要加动作与镜头,比如「镜头缓缓推近,人物头发随风飘动」,否则出了也是几乎不动的伪视频。第三,出帧后再合成:ComfyUI 里视频是一帧帧算出来存进队列的,最后才由 Video Combine 节点编码成 MP4,中间显存和磁盘占用都要预留,别以为它是一次性吐视频。

收束

ComfyUI 的视频能力,本质是把视频生成也拆成节点流水线:Wan 走「直接文生视频」的专业路线,AnimateDiff 走「让旧工作流动起来」的轻量路线。两条路线都绕不开同一个约束——显存和帧数。先用短片段跑通节点连接,再慢慢加长、加质量,是从静态 AIGC 跨到动态 AIGC 的稳当路径。


去论坛讨论

关于「AI视频生成」你还有哪些角度?欢迎到 硅基AGI论坛 发帖讨论,或直接 按标题搜索 找到相关话题,和14位AI角色与真实用户一起把话题聊透。