ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

LTX-Video 本地部署快速上手指南:8GB 显卡十几秒生成一段视频

LTX-Video 本地部署快速上手指南:8GB 显卡十几秒生成一段视频 LTX-Video 本地部署快速上手指南8GB 显卡十几秒生成一段视频【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video8GB 显卡一条命令十几秒出一条 4 秒小视频。这就是 LTX-Video——开源 DiT 架构的视频生成模型DiT 就是用 Transformer 做扩散的写法不用深究知道它是模型骨架就行。文生视频、图生视频、片段续写、风格重制一个模型全都能干。本文按能不能用 → 怎么用 → 用得好三段带你本地跑通。一、能不能用先确认你的卡够不够格结论8GB 显存的 NVIDIA 卡就能起步选错配置比没有卡更浪费时间。configs/ 下四个主力配置一张表定生死配置文件最低显存1216×70430fps 速度质量一句话定位ltxv-2b-0.9.8-distilled.yaml8GB约 25 FPS85/1008GB 卡、快速试错ltxv-13b-0.9.8-distilled.yaml16GB约 30 FPS92/100生产主力ltxv-13b-0.9.8-distilled-fp8.yaml16GB约 32 FPS91/10016GB 卡榨速度需装 Q8-Kernelsltxv-13b-0.9.8-dev.yaml24GB约 15 FPS95/100追极限画质不适合批量带 distilled 的是蒸馏版采样步数从 30 步砍到 10 步还免掉了 CFG/STG 两种引导引导每步多算一遍的纠偏开销零改动提速新手直接用蒸馏版就对了。环境自检两条命令 30 秒出结果nvidia-smi python -c import torch; print(torch.cuda.is_available(), torch.version.cuda)第二条应输出True 12.2这类结果。官方验证过的组合Python 3.10.5 CUDA 12.2 PyTorch ≥ 2.1.2。三种情况直接给结论别折腾情况结论GTX 10 系 / 老 Turing 卡fp8 配置跑不了只能用 bfloat16纯 CPU / Mac MPS能跑但不推荐没有 offload 加速慢到劝退想用 fp8 但没装 Q8-Kernels加载权重直接抛Q8-Kernels not found二、怎么用先出片再出花样第一条片子30 分钟跑通结论克隆 → 装依赖 → 首跑三步出一条 mp4首次跑通总耗时约 30 分钟。git clone https://gitcode.com/GitHub_Trending/ltx/LTX-Video cd LTX-Video python -m venv venv source venv/bin/activate pip install -e .[inference]这条完成代码获取和环境安装。装完不报错就算成功。首跑用 2B 蒸馏配置喂仓库自带的测试图 tests/utils/woman.jpegpython inference.py \ --prompt A woman stands in a foggy field, gentle breeze moving her hair, soft morning light \ --conditioning_media_paths tests/utils/woman.jpeg \ --conditioning_start_frames 0 \ --height 704 --width 1216 \ --num_frames 30 --seed 42 \ --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml这条在干什么以这张图的第 0 帧为锚点按提示词生成 30 帧视频。三个成功标志outputs/今天日期/下出现video_output_*.mp4能正常播放nvidia-smi显存没撞顶8GB 卡别超过 ~7.5GB首次运行会自动下载权重2B 约 5GB13B 约 15GB100Mbps 带宽下 13B 约 30 分钟看到下载进度条别急着杀进程。参考耗时RTX 4060 上 2B 蒸馏版 121 帧约 4 秒约 5 秒300 帧约 12 秒RTX 4090 上 13B 蒸馏版 121 帧约 3.5 秒单卡可开 3~5 路并发。只有一句话能不能出片能这是最纯粹的文生视频——不给任何条件媒体纯文本生成适合概念预览。python inference.py \ --prompt A vintage yellow car drives on a wet mountain road, camera following close behind \ --height 704 --width 1216 --num_frames 121 --seed 42 \ --pipeline_config configs/ltxv-13b-0.9.8-distilled.yaml这条在干什么只给提示词生成 121 帧30fps 下约 4 秒的 720p 视频。输出同样落在outputs/日期/下。参数建议值说明prompt≤200 词英文少于 120 词会触发自动扩写多花约 10 秒num_frames121遵守 8n1 规则9、17、25…121121 帧 ≈ 4 秒guidance_scale配置内3.0-3.5蒸馏配置固定为 1免 CFG不用管避坑一条文本编码器是 PixArt-XL-2纯英文模型中文提示词遵循度明显下降——先英文写好再回头润色。手里有张图怎么让它动起来产品图、人物照、截图都行。指定哪一帧锚定这张图模型负责把其余帧演出来python inference.py \ --prompt Slow zoom-in on the product, soft studio lighting \ --conditioning_media_paths ./product.png \ --conditioning_start_frames 0 --conditioning_strengths 1.0 \ --height 704 --width 1216 --num_frames 121 \ --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml这条在干什么把 product.png 钉在视频第 0 帧生成 121 帧图生视频。官方效果示例参数建议值说明conditioning_start_frames0锚定帧号图放开头就写 0conditioning_strengths0.8-1.0越接近 1 越忠于原图image_cond_noise_scale0.15给条件帧加一点噪防止画面僵死避坑一条conditioning_media_paths和conditioning_start_frames必须成对出现且数量一致少一个直接抛ValueError。有段旧素材怎么续写同一段视频接前接后都行方向靠conditioning_start_frames的取值切换python inference.py \ --prompt The car continues driving into the sunset \ --conditioning_media_paths clip.mp4 \ --conditioning_start_frames 0 \ --num_frames 257 --seed 42 \ --pipeline_config configs/ltxv-13b-0.9.8-distilled.yaml这条在干什么以 clip.mp4 为条件生成 257 帧约 8.5 秒的完整视频原片段被接进新片段里。目标参数设法接片尾向后延start_frames 写 0num_frames 原片段帧数 新增帧数补片头向前延start_frames num_frames - 原片段帧数避坑一条条件视频帧数要满足 8n19、17、25…目标 num_frames 要是 8 的倍数否则日志出现 trim 警告首尾会被裁掉一截。想整段换个风格怎么办这是视频到视频v2v把原片喂给--input_media_path提示词定风格构图基本保留python inference.py \ --prompt The same scene rendered in watercolor style \ --input_media_path raw.mp4 \ --height 704 --width 1216 --num_frames 121 \ --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml这条在干什么读入 raw.mp4超出 num_frames 的帧自动截断整段按水彩风格重绘。参数建议值说明num_frames与源视频一致显存紧张就调小分辨率704×12168GB 卡先降到 576×1024 再跑避坑一条v2v 的显存占用和纯生成一样吃紧8GB 卡别直接上 704×1216先 576×1024 验证流程。三、用得好快、省、稳速度和画质先保哪个口诀先保帧率再谈分辨率1216×704 是甜点别硬推 4K。显存随分辨率近似线性增长分辨率减半显存约省 60%1216×704 是模型调优点往 4K 硬推显存涨 4 倍质量没有等比回报帧数别贪长121 帧4 秒起步257 帧以内最稳超过 720×1280 和 257 帧的效果都不是最佳offload_to_cpu不是提速手段——它在 30GB 以下显存才生效且生成时间增加约 20%只救急不提速。单卡吞吐参考1216×70430fpsRTX 4060 跑 2B 蒸馏约 25 FPSRTX 4090 / A100 跑 13B 蒸馏约 35 FPS10 秒300 帧视频约 8.6 秒。要花多少钱按租卡口径估算量级心里有数即可档位硬件月成本量级日吞吐10 秒视频个人RTX 4060 ×1约 ¥300-500约 500 段小团队RTX 4090 ×2约 ¥3000-5000约 5000 段企业A100 ×8约 ¥30000-50000约 50000 段省钱点两个非实时负载走竞价实例能再降 60% 以上单张 4090 开 3~5 路并发是 13B 蒸馏版的舒适区别急着堆卡。翻车急救包九成问题逃不开显存、下载、依赖三类对照下表现场处置现象原因解法CUDA out of memory704×1216121 帧太重降到 576×1024、num_frames 改 81或换 fp8 配置Q8-Kernels not found用了 fp8 配置但没装 Q8 内核按官方说明安装 Q8-Kernels或临时切回 bfloat16 配置权重缺失 / 大小不对自动下载中断核对配置里checkpoint_path13B 权重应约 15GB重跑触发续传pip 依赖冲突、环境损坏transformers 超出 4.47.2-4.52 区间全新 venv pip install -e .[inference] --force-reinstall帧间抖动、动作跳变时空引导模式不匹配配置里stg_mode改为attention_values细节模糊、色彩失真VAE 解码参数偏了decode_noise_scale调到 0.02-0.03确认空间上采样器权重是新版文本和画面对不上文本编码器没下全核对配置里text_encoder_model_name_or_path是否完整两个高频误区一是盲目追 4K记住先保帧率再谈分辨率二是把offload_to_cpu当常规提速它只救急加了反而慢 20%。参数速查常改的参数就这几个一页带走参数推荐范围一句话说明height / width704 × 121632 的倍数不满足会自动补边再裁回num_frames30-3008n1 规则121 帧约 4 秒 30fpsframe_rate24 / 30输出帧率默认 30seed0-1000000默认 171198固定即可复现同一结果guidance_scale配置内3.0-3.5蒸馏配置为 1免 CFG 不用调num_inference_steps配置内20-40dev 配置 30 步蒸馏 10 步stg_mode配置内attention_values另有 attention_skip / residual / transformer_blockdecode_noise_scale配置内0.01-0.03默认 0.025影响解码后的色彩precision配置内bfloat16 / float8_e4m3fnfp8 需装 Q8-Kernelsconditioning_strengths0-1条件强度默认 1.0越接近 1 越忠于原素材image_cond_noise_scale0.1-0.2默认 0.15防止条件帧画面僵死offload_to_cpuTrue / False30GB 以下显存才生效只救急不提速有 8GB 显存就先跑 2B 蒸馏版把流程走熟上生产再切 13B 蒸馏、fp8 兜底——这条路线就是全部选型逻辑。【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表