ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Wan2.1-VACE-14B 快速上手指南:一个模型覆盖视频生成、视频编辑与参考图生成

Wan2.1-VACE-14B 快速上手指南:一个模型覆盖视频生成、视频编辑与参考图生成 Wan2.1-VACE-14B 快速上手指南一个模型覆盖视频生成、视频编辑与参考图生成【免费下载链接】Wan2.1-VACE-14B项目地址: https://ai.gitcode.com/hf_mirrors/Wan-AI/Wan2.1-VACE-14BWan2.1-VACE-14B 是 Wan2.1 系列的一体化视频生成与编辑模型输入文本、参考图、视频或掩码输出 480P 或 720P 视频。1.3B 轻量版可在消费级显卡上运行14B 旗舰版需要多卡部署。适合想做 AI 视频创作、寻找开源视频编辑方案的创作者与开发者。它能做什么以往做 AI 视频文生视频、图生视频、视频编辑往往要分别找不同模型参数和用法各不相同。VACEVideo Creation and Editing把这些任务放进同一个 DiT 架构官方提供 14B 与 1.3B 两个规格14B 支持 480P 和 720P1.3B 支持 480P。它最有特色的是参考图生成视频R2V给几张参考图片加一段文字描述模型就能生成这些主体同框、风格统一的视频。官方示例用两张人物与卡通蛇的图片直接生成两者互动的新年场景视频这类任务不需要任何预处理。第二类能力是视频编辑V2V与掩码编辑MV2V输入已有视频加文字指令只修改你指定的区域或内容。这两个任务需要额外预处理用官方 vace_preproccess 脚本从视频中提取深度、姿态或掩码区域等条件再和提示词一起传给模型。模型还支持文生图复用视频模型指定单帧即可输出 1024x1024 的图片。Wan2.1 系列整体支持中英文视觉文本生成也就是能在画面里写出可读的文字。配套的 Wan-VAE 可以对任意长度的 1080P 视频做编解码而不丢失时序信息保证了长视频条件的处理质量。硬件与版本门槛 两个版本的规格对比数据均来自官方 README项目VACE-1.3BVACE-14B本仓库参数量1.3B14B支持分辨率480P不支持 720P480P、720P显存需求官方未公布同系列 T2V-1.3B 加 --offload_model True --t5_cpu 后需 8.19GB官方未公布单卡建议开 offload 与 t5_cpu 降显存生成耗时官方未公布同系列 T2V-1.3B 在 RTX 4090 上生成 5 秒 480P 视频约 4 分钟未做量化官方未公布推荐 GPURTX 4090 等 24GB 消费级显卡多卡官方示例为 8 卡部署方式单卡直接运行FSDP xDiT USPUlysses/Ring 策略分布式推理本仓库为 14B 权重库bf16 权重文件合计约 70GB包含 7 个分片的 DiT 权重、Wan2.1_VAE.pth、umt5-xxl T5 文本编码器和 google/umt5-xxl 词表下载前请先预留磁盘空间。快速上手整个流程四步拿权重、配环境、跑推理、按需多卡。第一步获取权重。本仓库就是 Wan2.1-VACE-14B 的官方权重仓库git clone https://gitcode.com/hf_mirrors/Wan-AI/Wan2.1-VACE-14B第二步配置环境。要求 torch 版本不低于 2.4.0依赖安装以官方 Wan2.1 推理仓库的 requirements 为准多卡推理另需安装xfuser0.4.1。推理代码 generate.py 在官方 Wan2.1 仓库中用--ckpt_dir指定本仓库目录即可。第三步单卡推理。R2V 任务无需预处理直接传参考图python generate.py --task vace-14B --size 1280*720 --ckpt_dir ./Wan2.1-VACE-14B --src_ref_images girl.png,snake.png --prompt ...。V2V 与 MV2V 任务则先把 src_video、src_mask 处理好再传入。第四步多卡部署。用torchrun --nproc_per_node8加--dit_fsdp --t5_fsdp --ulysses_size 8启动 8 卡推理1.3B 模型的注意力头数为 12不能被 8 整除官方建议改走--ring_size 8。不想敲命令的话官方 gradio/ 目录下的 vace.py 自带网页界面单卡直接运行多卡加--mp --ulysses_size 8。显存占用怎么降单卡显存不足时加--offload_model True --t5_cpu把模型权重和 T5 编码器卸载到 CPU官方实测 1.3B 系列这样配置后只需 8.19GB。多卡推理想提速社区 TeaCache 方案能带来约 2 倍加速。生态与扩展官方已将 Wan2.1 的 T2V、I2V 接入 DiffusersComfyUI 自 2025 年 2 月起支持 Wan2.1 且覆盖 VACE 任务VACE 的 Diffusers 集成还在官方 Todo 清单里尚未上线。围绕 Wan2.1 的社区项目也比较活跃Phantom 基于 T2V-1.3B 做单多主体参考视频生成框架UniAnimate-DiT 基于 I2V-14B 训练人物动画模型并开源训练代码DiffSynth-Studio 提供 FP8 量化、显存优化和 LoRA 训练CFG-Zero 针对采样引导策略做优化。交流与反馈入口见 README 中的 Discord 与微信群。局限与适用边界几个边界先说清楚14B 不适合消费级单卡。权重约 70GB即使 offload 到 CPU单卡速度也很慢8 卡分布式才是官方推荐姿势。VACE 还不在 Diffusers 里。想嵌入现有 Diffusers 流水线的目前只能用 T2V 或 I2V或者走 ComfyUI。编辑任务有预处理成本。V2V、MV2V 要先提取深度、姿态、掩码等条件入门建议先跑 R2V。生成耗时以分钟计。没有实时交互能力也不适合直接当线上 API 服务用。如果只有 8 到 16GB 显存或需要开箱即用的托管服务可以暂时观望手上有 RTX 4090 且想试视频编辑的建议从 1.3B 开始。结尾一句话总结一个模型、多种输入、Apache 2.0 协议Wan2.1-VACE 目前是开源领域覆盖视频生成与编辑任务最完整的方案之一。24GB 单卡用户先用 1.3B 验证流程8 卡服务器用户再上 14B 的 720P。【免费下载链接】Wan2.1-VACE-14B项目地址: https://ai.gitcode.com/hf_mirrors/Wan-AI/Wan2.1-VACE-14B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表