ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

如何在AMD MI300X上部署Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym:vLLM端到端教程

如何在AMD MI300X上部署Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym:vLLM端到端教程 如何在AMD MI300X上部署Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-symvLLM端到端教程【免费下载链接】Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym本教程手把手教你在 AMD MI300X 上使用 vLLM 部署 Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym。这是 AMD 官方基于 Qwen1.5-MoE-A2.7B-Chat 发布的 W8A8 INT8 量化 MoE 模型专为 AMD MI300 系列 GPU 优化配合 vLLM 推理引擎即可快速搭建 OpenAI 兼容的大模型推理服务尤其适合在 ROCm 环境下追求低显存、高吞吐的部署场景。一文看懂这个INT8量化MoE模型是什么Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym 本质上是通义千问 MoE 模型的量化版本使用 AMD-Quarkv0.11.2把路由专家层的权重量化为 INT8per-channel 静态对称、激活量化为 INT8per-token 动态对称而注意力、共享专家与路由层保持原精度兼顾速度与精度。项目详情基础模型Qwen1.5-MoE-A2.7B-Chat模型架构Qwen2MoeForCausalLM量化方案W8A8 INT8AMD-Quark v0.11.2量化范围仅路由 MoE 专家层总参数 / 激活参数约 143 亿 / 约 27 亿专家配置60 个专家每 token 激活 4 个上下文长度32,768支持硬件AMD MI300 / MI350 / MI355推理引擎vLLMQuarkW8A8Int8MoEMethodMoE混合专家模型的核心特点是稀疏激活虽然总参数量高达 143 亿但每次推理只计算被路由激活的少数专家实际开销接近 27 亿参数模型这正是它轻量又强大的秘密。为什么推荐在AMD MI300X上用vLLM部署显存友好INT8 量化让专家权重体积减半约 16GB 的模型文件在 MI300X 的 192GB HBM 上轻松加载可留出大量 KV Cache 空间支撑长上下文。精度损失小官方在 gsm8k 评测中得分 51.18与原始 bf16 版本差距很小INT8 量化没有牺牲可用性。ROCm 深度优化vLLM 通过 Triton INT8 fused-MoE 内核在 AMD GPU 上高效执行路由专家计算无需手写 CUDA 移植。开箱即用量化配置已写入 config.json 的 quantization_config 字段vLLM 启动时自动识别无需手动指定量化参数。部署前准备硬件与软件清单硬件要求AMD Instinct MI300X 加速卡192GB HBM3至少 20GB 空闲磁盘空间存放模型权重建议 64GB 以上系统内存软件要求已安装 ROCm 的 Linux 系统Python 3.10 及以上版本支持 ROCm 的 vLLM 版本第一步下载模型权重文件在服务器上执行以下命令克隆模型仓库仓库默认使用 Git LFS 管理大文件git clone https://gitcode.com/hf_mirrors/amd/Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym cd Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym git lfs pull克隆完成后你会看到以下关键文件config.json模型结构与量化配置quantization_configvLLM 依赖它自动识别 INT8 量化方式model-00001-of-00004.safetensors ~ model-00004-of-00004.safetensors4 个权重分片model.safetensors.index.json权重分片索引tokenizer.json / vocab.json / merges.txt分词器文件chat_template.jinja对话模板generation_config.json默认生成参数temperature 0.7、top_p 0.8、top_k 20 等 小提示如果发现 safetensors 文件只有一百多字节说明真实权重尚未拉取执行 git lfs pull 即可模型实际约 16GB。第二步安装vLLM推理引擎在 ROCm 环境下直接通过 pip 安装pip install vllm安装完成后可用 vllm --version 确认版本。vLLM 已内置 Quark INT8 fused-MoE 内核支持无需额外安装插件。第三步一条命令启动OpenAI兼容API服务进入模型目录后执行vllm serve ./Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym \ --max-model-len 32768 \ --gpu-memory-utilization 0.9 \ --trust-remote-code参数说明--max-model-len 32768充分利用模型 32K 上下文能力--gpu-memory-utilization 0.9控制显存占用比例防止 OOM--trust-remote-code允许加载模型所需的自定义代码看到 Application startup complete 日志说明服务已在 8000 端口就绪。第四步快速验证推理效果方式一curl 命令测试curl http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d {model: ./Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym, messages: [{role: user, content: 你好请介绍一下你自己}], max_tokens: 200}方式二Python 客户端调用from openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) resp client.chat.completions.create( model./Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym, messages[{role: user, content: 用一句话解释什么是MoE模型}], max_tokens200, ) print(resp.choices[0].message.content)返回正常的文本回复即代表部署成功精度验证复现gsm8k评测结果如需验证量化模型的数学推理能力可参考 README.md 中给出的评测命令使用 lm-evaluation-harnesslm_eval \ --model vllm \ --model_args pretrained./Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym,max_model_len4096,gpu_memory_utilization0.4,enforce_eagerTrue,trust_remote_codeTrue \ --tasks gsm8k --num_fewshot 5 \ --batch_size auto官方评测结果为 gsm8k5-shot得分 51.18可作为参考基线。常见问题与调优技巧显存不足OOM调低 --gpu-memory-utilization如 0.6或缩短 --max-model-len。生成质量不佳默认生成参数已定义在 generation_config.jsontemperature 0.7 / top_p 0.8 / top_k 20 / repetition_penalty 1.05可在请求中按需覆盖。首次加载较慢vLLM 首次加载需要内核预热与权重映射属于正常现象。离线批量推理如需离线处理可用 vLLM 的 LLM 类加载同一模型路径量化配置同样自动生效。结语通过本文的端到端教程你已在 AMD MI300X 上成功部署了 Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym 这个 INT8 量化 MoE 模型。得益于 AMD-Quark 的 W8A8 量化与 vLLM 的 fused-MoE 内核143 亿参数的模型能以约 27 亿参数的激活开销高效运行兼顾速度、显存与精度。无论是搭建私有对话服务还是做多路并发推理这套方案都是 AMD 平台上的高性价比之选。【免费下载链接】Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen1.5-MoE-A2.7B-Chat-w-int8-a-int8-sym创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表