ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

从一张图到一段动漫视频:Index-AniSora 开源动漫视频生成模型上手教程

从一张图到一段动漫视频:Index-AniSora 开源动漫视频生成模型上手教程 从一张图到一段动漫视频Index-AniSora 开源动漫视频生成模型上手教程【免费下载链接】Index-anisora项目地址: https://gitcode.com/gh_mirrors/in/Index-anisora做动漫二创时你是不是也卡在画不出来这一步想给喜欢的角色做个动态镜头要么不会画分镜要么逐帧绘制费时费力用通用视频生成模型又总生成三次元味太重的画面线条、表情、动作完全不对味。Index-AniSora 就是为解决这个问题而生的开源动漫视频生成模型它由哔哩哔哩团队开源输入一张角色图片加一段文字描述就能生成风格统一的动漫视频镜头还附带 360 度角色旋转、任意帧控制、低清视频修复等一整套创作能力。一、先认清仓库结构六个模块分别能干什么打开仓库根目录你会发现它不是单个模型而是一整套动漫视频生成工具箱每个目录对应一个版本或配套能力。选错版本是新手最常见的浪费所以先花 30 秒看这张对照表目录基础模型定位适合谁anisoraV1_inferCogVideoX-5B可控生成局部区域、关键帧插帧想玩细粒度控制、RTX 4090 部署anisoraV2_gpu / anisoraV2_npuWan2.1-14B高质量镜头 蒸馏加速 昇腾 NPU追求稳定出片、国产芯片用户anisoraV3 / anisoraV3.2Wan2.1-14B任意帧推理、360 度旋转、超分、风格迁移进阶创作想要最新能力anisora_anymaskWan2.1-14B时空掩码控制局部生成、抖动修复需要精准控制画面局部data_pipeline-动漫数据清洗管线想自建训练数据reward-动漫画风评测打分模型做强化学习或效果评估一句话总结想快速出片选 V2想玩花活选 V3/V3.2想做精细控制选 V1 或 anymask。下文上手流程以 V3 为例它的能力最全上手成本却不高。二、跑通第一个镜头图生视频的完整流程V3 的推理入口是anisoraV3/generate-pi-i2v-any.py整个过程分三步装环境、下权重、跑命令。第一步克隆仓库并安装依赖建议 Python 3.10git clone https://gitcode.com/gh_mirrors/in/Index-anisora cd anisoraV3 conda create -n wan_gpu python3.10 conda activate wan_gpu pip install -r req-fastvideo.txt pip install -r requirements.txt pip install -e .第二步准备权重和输入。从官方模型托管平台下载 V3 对应版本的 checkpoint解压后目录结构保持Wan2.1-I2V-14B-480P的命名。输入图片放在anisoraV3/data/inference-imgs/下仓库自带了两张现成的动漫帧红发少女、宫廷场景可以直接拿来测试。第三步运行推理命令python generate-pi-i2v-any.py \ --task i2v-14B \ --size 1280*720 \ --ckpt_dir Wan2.1-I2V-14B-480P \ --image output_videos_any \ --prompt data/inference_any.txt \ --base_seed 4096 \ --frame_num 81参数含义不复杂--image是输出目录--prompt指向提示词文件--frame_num控制时长81 帧 ≈ 5 秒16fps。跑完后到output_videos_any/里找结果即可。单张 4090 就能跑显存不够就把--size降到960*544。如果你有两张卡加torchrun --nproc_per_node2 --master_port 43210前缀并补上--dit_fsdp --t5_fsdp --ulysses_size 2其余参数不变。三、提示词不是玄学aesthetic score 和 motion score 的调法V3 的提示词格式比通用模型多了一套评分后缀写得好不好直接决定出片质量。标准结构长这样画面描述 aesthetic score: X.X. motion score: X.X. There is no text in the video.data/inference_any.txt里有一条现成范例把红发少女和狐狸松鼠的互动描述得很细。三个关键点aesthetic score美学分建议 5.0–7.0控制画面质感和电影感越高越大片但过高容易偏离原图风格。日常 5.5 是个稳妥起点。motion score动作分建议 2.0–4.0控制运动幅度。注意 V3 的 motion score 范围和 V2 不同——V2 推荐 1–2V3 调高到 2.0–4.0 才能发挥增强后的动态能力动作太僵硬就往上调。There is no text in the video 这句不要省不加这句话模型很可能在画面上生成乱码字幕这是动漫视频生成的经典翻车点。描述本身写得越具体越好V3 训练时用的是长描述。如果一时写不出可以先用大语言模型把一句话扩写成细节丰富的段落再喂给模型。四、进阶玩法V3 真正拉开差距的三个功能基础图生视频只是开胃菜V3 的看家本领在下面三个场景全部走同一个推理脚本。任意帧控制不只控制首帧中间帧、尾帧都能指定。提示词文件里用拼接多张图和位置例如图A,图B0,0.5表示第一张作首帧、第二张作中间帧。这意味着你可以给关键动作打点让角色按你设定的节奏表演而不是放任模型自由发挥。角色 360 度旋转一张正面立绘生成环绕视频。给出角色正面图配合data/inference_360.txt中的提示词和--frame_num 81就能得到角色转一圈的多角度一致视频。对角色设定集、3D 建模参考这类需求很实用官方建议时长保证 5 秒让旋转转满整圈。超低分辨率视频超分90p 拉到 720p/1080p。这是 V3 的另一项能力用更少的采样步数生成细节更丰富的视频。官方对比示例中低清输入和高清输出之间的差异非常直观除此之外仓库还提供了视频风格迁移用首尾帧换画风、多模态引导姿态、深度、线稿、音频都能当控制条件等玩法对应脚本和示例都放在anisoraV3/wan/目录下。五、避开 4 个常见的坑帧数必须满足 F8x181、49、129 都可以写个 80 或 100 会直接报错或出问题这是 Wan 系模型的硬性约束。显存不足先降分辨率别急着加卡--size从1280*720降到960*544通常就能解决问题V3.1 还有专门适配 12GB 显存的版本。结果动作僵硬先调 motion score 而不是重写提示词运动幅度不足多半是动作分太低V3 建议区间内逐步上调每次改 0.5 左右观察变化。多卡并行时--nproc_per_node和--ulysses_size必须一致不一致会导致并行切分错乱跑出花屏结果。六、下一步做什么先别急着上复杂玩法。建议按这个顺序走克隆仓库 → 用自带图片和inference_any.txt原样跑通一次确认环境没问题→ 换成自己的角色图试着调 motion score → 再尝试任意帧和 360 度旋转。每一步都有现成示例文件兜底出问题也能对照排查。想深入的话V1 的训练代码、NPU 版本anisoraV2_npu全流程昇腾 910B 国产芯片训练、以及reward目录下的动漫画风评测模型都在仓库里值得后续慢慢探索。如果你正在做动漫二创或角色设定视频这个仓库可能是目前最对味的开源选择。【免费下载链接】Index-anisora项目地址: https://gitcode.com/gh_mirrors/in/Index-anisora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表