
Qwen MoE 模型 3 分钟上手30B 激活量只有 3B显存直接省到 1/4【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5团队选模型卡在一个问题上要效果就得上大参数参数一大GPU 预算和延迟也跟着涨。Qwen 给出的答案是混合专家MoE模型比如 30B-A3B 和 235B-A22B。名字里的 A 是 activated 的缩写30B-A3B 表示总参数 30B但每个 token 只激活 3B。参数全存着、计算只走一小部分这就是它比同档 Dense 模型省钱的根本原因。下面用官方仓库里的真实数据一次讲清它怎么工作、有多快、怎么快速上手以及什么团队该选它。先看关键指标MoE 和 Dense 差在哪 命名规则先说清楚docs/source/getting_started/concepts.mdDense 模型直接用总参数量如 4B、32BMoE 用「总参数-A激活参数」如 30B-A3B、235B-A22B。Qwen 谱系从 0.6B 到 235B-A22B 都开放了权重。关键指标Qwen3-14BDenseQwen3-30B-A3BMoE每 token 实际激活参数14B3B推理框架Transformers / SGLang / vLLMSGLang、vLLM需支持 MoE典型单卡显存33.3 GB见下文实测61.3 GB但吞吐反而更高适用定位单卡、长文本、简单任务要高能力又不想堆卡数的场景框架版本要求出处vLLM≥0.9.0docs/source/deployment/vllm.mdSGLang≥0.4.6.post1README.mdTransformers≥4.51.0README.md一句话结论MoE 的「总参数」决定能力上限和存储「激活参数」决定单次计算量两者拆开之后成本和效果的绑定被松开了。MoE 是怎么工作的路由把 30B 拆成 3B 的活MoE 替换的是 Transformer 里负责逐 token 变换的那一层。它内部放着一组并行子网络叫专家前面加一个路由网络路由网络对每个 token 给全体专家打分只挑分数最高的若干个专家参与计算其余权重这轮完全不动选中的专家输出按分数加权求和得到该 token 的层输出。说白了每个 token 走哪几位专家是逐 token 动态决定的不同内容可以命中不同专家。注意「K 具体等于几」这类细节要看具体模型的 config本文不替你猜。上图就是模型跑起来之后的样子。服务启动后你像调用普通 OpenAI 接口一样对话路由和专家选择在引擎内部完成应用层完全无感。实测速度与显存只认仓库里的数字 以下数据全部来自官方速度基准页 docs/source/getting_started/speed_benchmark.md环境H20 96GB 单卡batch size 1固定生成 2048 tokens。模型输入长度量化框架速度 tokens/s显存 GBQwen3-30B-A3B30720BF16SGLang1283.94—Qwen3-30B-A3B30720BF16Transformers27.0361.3Qwen3-14B30720BF16Transformers155.3833.3把「总参数更大」和「速度更快」放在一起才是 MoE 的意义同输入 30720 下14B 走 Transformers 是 155.38 tokens/s、33.3GB而 30B-A3B 走 SGLang 能到 1283.94 tokens/s。激活量只有 3B计算量当然压得下来。更大的 235B-A22B 看这张同页 SGLang 数据量化GPU 数输入 129042 时速度BF168TP81639.54 tokens/sFP84TP41319.66 tokens/sFP8 把卡数从 8 压到 4速度只掉了 19%。MoE 的大参数不等于大成本激活参数才是计算量的决定项。快速上手vLLM 一条命令启动 MoE 服务 生产部署推荐 vLLM版本 ≥0.9.0一条命令起 OpenAI 兼容服务vllm serve Qwen/Qwen3-30B-A3B-Instruct-2507 --port 8000 --max-model-len 262144服务起在http://localhost:8000/v1。大陆网络可先设export VLLM_USE_MODELSCOPEtrue从 ModelScope 拉权重详见 docs/source/deployment/vllm.md。本地体验则用ollama run qwen3:8b或 LM Studio 加载 GGUF 即可。选型建议你的团队适合哪一款 ⚖️单卡、小团队、要效果选 30B-A3B。单张 H20 就能跑能力接近更大 Dense 模型延迟由 3B 的激活量决定。多卡、生产环境、要顶格推理选 235B-A22B。BF16 需 8 卡张量并行上 FP8 可压到 4 卡TP4。CPU 或消费级 GPU 为主不用 MoE走 Ollama / LM Studio 量化版 GGUF门槛最低。Apple Silicon用 mlx-lm≥0.24.0找名字以 MLX 结尾的权重。避坑用 Transformers 直跑 30B-A3B 只有 27.03 tokens/sMoE 的吞吐红利要靠 SGLang 或 vLLM 才拿得到。延伸阅读官方速度与显存基准docs/source/getting_started/speed_benchmark.mdvLLM 部署与调优含 OOM 排查docs/source/deployment/vllm.md量化方案FP8 / AWQ / GGUFdocs/source/quantization/awq.md命名规则与关键概念docs/source/getting_started/concepts.md本地运行Ollama / llama.cpp / LM Studiodocs/source/run_locally/ollama.mdAPI 调用示例与思考模式开关README.md【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考