
把 8B 模型压进 4GB 显存ComfyUI 低显存图像描述实操指南【免费下载链接】bulmaModern CSS framework based on Flexbox项目地址: https://gitcode.com/GitHub_Trending/bu/bulma显卡只有 8GB这套 ComfyUI 低显存方案值得看一眼。它基于 ComfyUI_SLK_joy_caption_two 节点让你用 8B 级语言模型给图片生成文字描述你不用盯着 OOM就是显存直接爆掉的报错。先算一笔账显存能省多少 8B 级模型按全精度加载显存占用常在 10GB 以上8GB 显卡连启动都费劲。做完这套 ComfyUI 省显存配置8GB 显卡可以稳定跑整体占用压到 4GB 以内。状态显存占用8B 模型全精度未做优化10GB 以上4-bit 量化 生成后清缓存 控制描述长度压到 4GB 以内8GB 显卡稳定运行ComfyUI 低显存图像描述工作流总览工作流总览描述生成节点在整条 ComfyUI 流程中的位置。拆开看三招各自省在哪 显存开销主要三块模型权重、中间计算的缓存、生成文本的长度。三招各砍一块4-bit 量化把每个参数的精度从 16 位压到 4 位模型体积约缩到四分之一加载时的基础占用跟着下来。对图像描述这类任务多数场景下质量掉得不多。缓存清理PyTorch 会把中间结果留在显存的临时堆里不主动还。清理分三级gc.collect()收 Python 层的垃圾unload_all_models()把没在用的模型卸掉soft_empty_cache()清空临时堆。工作流设计描述越短要生成的字token越少一张图一个阶段地跑能避免 CLIPComfyUI 里做图像编码的模型和语言模型同时挤在显存里。跟着做四步把流程跑起来第 1 步装好环境只跑两条命令git clone https://gitcode.com/GitHub_Trending/bu/bulma pip install -r requirements.txt第一条把节点仓库拉到本地第二条装依赖——bitsandbytes是 4-bit 量化加载的底层库peft负责给大模型加省显存的参数补丁。第 2 步把模型切成 4-bit 打开joy_config.json把model字段指到量化版本model: [ unsloth/Meta-Llama-3.1-8B-Instruct-bnb-4bit ]这一步在干什么让节点默认加载 4-bit 版本。想换其他量化版本比如 NF4 格式改这一行的模型名就行。第 3 步每生成一次清一次缓存uitls.py里的clear_cache()就是前面说的三级清理。你单张图跑完调一次批量处理时把它挂在每张生成之后别攒到最后一次性清。ComfyUI 低显存批量处理时的缓存清理设置批量工作流每张图生成结束后触发一次缓存清理。第 4 步把工作流改成分步跑两条原则出图和描述分阶段跑别让两个大模型同时在显存里CAPTION_LENGTH控制描述长度的参数跟着显存走卡越小这个参数越要克制。验证效果8GB 显卡跑起来什么样 加载示例工作流生成一张图然后打开任务管理器看 GPU 占用8GB 显存的设备能稳定跑完不触发 OOM。ComfyUI 低显存下的 joy_caption 示例效果示例工作流的描述生成效果可对照任务管理器核对显存占用。显存不到 6GB再叠三招开启模型下载缓存别反复拉模型描述长度收到 50 词上下也就是 very short 档位关闭 ComfyUI 实时预览生成期间少占一块显存。绕开这 3 个新手常踩的坑 ⚠️依赖没装全就跑量化模型缺bitsandbytes会直接报错先确认pip install装好了再改model字段。8GB 的卡换回全精度模型全精度 10GB 起步显存不够就别切回去。把首次下载当卡死4-bit 模型首次运行也要走一遍下载uitls.py里有下载缓存第二次起就不用再拉。写在最后把joy_config.json里的 model 改成 4-bit跑一张图再对照任务管理器看一眼实际占用。显存不够的问题先用配置解再考虑换卡。【免费下载链接】bulmaModern CSS framework based on Flexbox项目地址: https://gitcode.com/GitHub_Trending/bu/bulma创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考