ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

4GB 显存跑 70B 大模型:AirLLM 低显存推理全解析

4GB 显存跑 70B 大模型:AirLLM 低显存推理全解析 4GB 显存跑 70B 大模型AirLLM 低显存推理全解析【免费下载链接】airllmAirLLM 70B inference with single 4GB GPU项目地址: https://gitcode.com/GitHub_Trending/ai/airllm加载 Llama 3.1 70B 时屏幕上最先出现的往往是红色的 CUDA out of memory——70B 全精度模型需要几十 GB 显存而一块消费级显卡只有 4GB。AirLLM 是一个低显存大模型推理框架让 70B 模型在 4GB 的 GPU 上跑起来8GB 能跑 Llama 3.1 405B2.8T 参数的 Kimi K3 甚至能在 4GB 以下显存内运行而且不依赖量化、蒸馏或剪枝。一句话认识它AirLLM 是一个小卡跑大模型的推理框架把模型按层拆成磁盘文件GPU 上同时只保留一层权重因此显存占用取决于单层大小而不是总参数量。最能说明问题的数字全精度 70B 模型约 4GB 显存。它是怎么做到的常规做法要把整个模型塞进显存参数越大门槛越高。AirLLM 先把模型拆成按层存放的碎片文件由 persist 模块 负责推理时只把当前这一层读进显存参与计算同时预取下一层把磁盘读取的等待藏在计算时间里。瓶颈从显存容量变成磁盘读取速度后第二步是块量化block-wise quantization把权重压缩成 4bit 或 8bit单次读取的数据量变小读得更快精度损失却很小。对 MoE 混合专家模型它做得更细专家不再整层加载而是逐个加载——只载入当前 token 实际路由到的专家。这是 671B 的 DeepSeek-V3 只占约 12GB、2.8T 的 Kimi K3 只占 3.72GB 的原因。效果说话先说结论同样硬件下4bit 块量化后推理时间从 449 秒降到 157 秒约 2.9 倍提速。显存占用则与参数量基本脱钩以下是官方口径的实测数据模型参数量显存需求Llama 3.x70B约 4GBLlama 3.1405B约 8GBDeepSeek-V3671B约 12GBKimi K32.8T3.72GBQwen3235B约 3GB这套方案自 2023 年 11 月首版发布以来被社区持续使用star 曲线一路上升。跑起来克隆仓库并安装git clone https://gitcode.com/GitHub_Trending/ai/airllm pip install airllm最小推理代码换个模型 ID 即可from airllm import AutoModel model AutoModel.from_pretrained(Qwen/Qwen3-32B)之后 generate 的调用方式与普通 transformers 模型一致。首次运行会把模型按层拆分并缓存到磁盘留意缓存目录空间。用之前想清楚磁盘空间按层拆分需要比模型文件更大的磁盘空间吃紧时可设置delete_original在拆分后删除原始文件。时间换空间推理速度天然慢于显存全量部署适合单机评测、本地实验、教学演示不适合高并发在线服务。替代方案取舍如果你的显存装得下模型高吞吐推理框架是更优选择AirLLM 的定位是先让它跑起来。版本约束个别新模型如 Kimi K3对 transformers、flash-attn 的版本有硬性要求跑之前先看 README 的 Updates 部分。如果你的硬件有限、只是想跑通并评测一个大模型AirLLM 是当下最直接的选择之一实现入口可以从 auto_model.py 开始看起。【免费下载链接】airllmAirLLM 70B inference with single 4GB GPU项目地址: https://gitcode.com/GitHub_Trending/ai/airllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表