ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

【ACL 2024】DeepSeekMoE:混合专家语言模型中的极致专家特化|从大模型稀疏架构专家视角

【ACL 2024】DeepSeekMoE:混合专家语言模型中的极致专家特化|从大模型稀疏架构专家视角 摘要本文解读 ACL 2024 论文《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》。该论文提出DeepSeekMoE 混合专家架构通过融合细粒度专家切分与共享专家隔离两大策略在总参数与总计算量不变的前提下实现极致的专家特化其特别之处在于把专家组合数从 120 提升到约 44 亿。实验表明16B 模型仅用 40% 计算量即匹敌 LLaMA2 7B推理速度达 7B 稠密模型的 2.5 倍且单卡 40GB 可部署为高效大模型架构提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机MoE 架构为什么做不到专家特化研究主线从问题到结论基准/方法设计两大核心策略方法组成全景方法细节公式与负载均衡设计实验设计与结果三阶段实验规模2B 验证实验主表16B 扩展与 145B 初步探索训练曲线与扩展性结果对比总结专家特化深度分析关键发现局限性常见问题FAQDeepSeekMoE 和 GShard 的核心区别是什么为什么细粒度专家切分有效共享专家有什么作用DeepSeekMoE 16B 需要多大算力部署DeepSeekMoE 与后续 DeepSeek-V2/V3 的关系为什么 MMLU 等多选任务表现偏弱参考链接论文基本信息项目内容标题英文Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models标题中文DeepSeekMoE混合专家语言模型中的极致专家特化作者Damai Dai, Chengqi Deng, Chenggang Zhao, R.X. Xu, Huazuo Gao, Deli Chen, Jiashi Li, Wangding Zeng, Xingkai Yu, Y. Wu, Zhenda Xie, Y.K. Li, Panpan Huang, Fuli Luo, Chong Ruan, Zhifang Sui, Wenfeng Liang机构DeepSeek-AI · 北京大学 · 清华大学 · 南京大学会议ACL 2024arXivhttps://arxiv.org/abs/2401.06066项目网站https://github.com/deepseek-ai/DeepSeek-MoE背景与动机MoE 架构为什么做不到专家特化大语言模型时代混合专家MoE是控制扩展参数成本的关键架构总参数量可以很大但每个 token 只激活其中一小部分专家。然而传统 MoE 架构如 GShard 的 top-2 路由、Switch Transformer 的 top-1 路由、Hash Layer 的固定哈希路由存在两大瓶颈知识混杂Knowledge Hybridity传统 MoE 只有 8–16 个专家每个专家被迫覆盖多种知识类型专家内部参数难以被同时高效利用知识冗余Knowledge Redundancy不同路由专家会重复学习通用知识造成参数浪费降低整体参数效率。DeepSpeed-MoE 曾从工程角度引入共享专家但未系统解决专家粒度问题。DeepSeekMoE 的关键差异在于从算法角度同时解决两个瓶颈细粒度切分对抗知识混杂共享隔离对抗知识冗余。核心问题可以概括为在保持计算成本不变的前提下如何让每个专家高度特化图 1DeepSeekMoE 16B 在 Open LLM Leaderboard 上以更少激活参数显著超越同规模开源模型研究主线从问题到结论图 8研究主线知识混杂与知识冗余 → 细粒度切分与共享隔离 → 40% 计算量匹敌 LLaMA2 7BMermaid 流程图基准/方法设计两大核心策略DeepSeekMoE 的架构设计围绕两大策略展开总专家参数与计算成本始终保持不变细粒度专家切分Fine-Grained Expert Segmentation将每个专家 FFN 拆分为 $m$ 个更小专家中间隐藏维度缩小到 $1/m$同时激活 $m$ 倍数量的专家。以 $N{}16, m{}4$ 为例激活 8 个专家时组合数从 $C_{16}^2120$ 暴涨到 $C_{64}^8\approx 4.4\times10^9$组合灵活性提升数个数量级每个 token 都能获得更精准的专家组合共享专家隔离Shared Expert Isolation固定 $K_s$ 个专家始终激活专门捕获所有 token 共需的通用知识其余路由专家专注特化知识从架构上消除路由专家间的参数冗余。2B 模型配置为 1 个共享专家 63 个路由专家激活 7 个16B 模型配置为 2 个共享专家 64 个路由专家激活 6 个。图 2DeepSeekMoE 架构(a) 传统 Top-2 路由 (b) 加入细粒度切分 (c) 加入共享隔离三种结构专家参数与计算量不变方法组成全景图 9方法组成细粒度专家切分、共享专家隔离与负载均衡双损失Mermaid 流程图方法细节公式与负载均衡设计细粒度切分下第 $l$ 层输出为 $mN$ 个专家的带权求和$\mathbf{h}t^l \sum{i1}^{mN} g_{i,t}\mathrm{FFN}i(\mathbf{u}_t^l) \mathbf{u}_t^l$路由权重 $g{i,t}$ 由 $\mathrm{Topk}({s_{j,t}}, mK)$ 归一化得到。共享隔离则让前 $K_s$ 个专家无条件激活路由只从剩余 $mN-K_s$ 个专家中选取 $mK-K_s$ 个。训练稳定依赖两类负载均衡损失Expert-Level Balance Loss$\mathcal{L}{\mathrm{ExpBal}} \alpha_1\sum{i1}^{N} f_i P_i$其中 $f_i$ 是专家 $i$ 被选择的频率、$P_i$ 是路由概率均值用小系数 $\alpha_1$ 防止路由坍塌Device-Level Balance Loss$\mathcal{L}{\mathrm{DevBal}} \alpha_2\sum{i1}^{D} g_i Q_i$把路由专家分成 $D$ 组每组部署在一个设备上用大系数 $\alpha_2$ 保证设备间计算均衡。所有模型使用 AdamW 优化器$\beta_1{}0.9,\beta_2{}0.95$与 warmup 后阶梯衰减调度。要点不增加任何参数与计算量仅改变专家粒度与激活方式。实验设计与结果三阶段实验规模实验分三个阶段验证2B 验证实验9 层、hidden 1280、100B tokens、8K 词表→16B 扩展实验28 层、hidden 2048、2T tokens、100K 词表→145B 初步探索62 层、hidden 4096、245B tokens。评测覆盖语言建模Pile、理解推理HellaSwag、PIQA、ARC、阅读理解RACE、DROP、代码HumanEval、MBPP、数学GSM8K、MATH、知识问答TriviaQA、NQ、多选MMLU、CEval、CMMLU与中文理解CLUEWSC、CHID。基线包括 Dense、Hash Layer、Switch Transformer、GShard、GShard×1.5 与 Dense×16。2B 验证实验主表指标DenseHashSwitchGShardDeepSeekMoEPile (Loss)2.0601.9321.8811.8671.808HellaSwag38.846.249.150.554.8ARC-challenge26.028.230.231.634.3HumanEval0.01.22.43.74.9TriviaQA (EM)4.96.58.910.216.6激活参数0.2B0.2B0.2B0.3B0.3BDeepSeekMoE 在所有指标上全面超越 GShard尤其在知识密集型任务TriviaQA上领先63%。消融实验下图显示细粒度切分与共享隔离各自带来增益且专家切分越细32→64 个专家性能持续提升。图 3消融实验细粒度切分与共享隔离各自带来性能增益更细粒度持续提升16B 扩展与 145B 初步探索vs DeepSeek 7B16B 仅用 40.5% 计算量74.4T vs 183.5T FLOPs整体性能可比知识密集型任务优势显著vs LLaMA2 7B仅 39.6% 计算量多数基准超越代码与数学推理尤其突出145B 初步结果仅 28.5% 计算量可比 DeepSeek 67B半激活版18.2% 计算量仍大幅超越 GShard 137B部署价值16B 模型可部署于单张 40GB GPU无需量化推理速度达 7B 稠密模型的2.5 倍。图 4路由专家冗余度分析DeepSeekMoE 对禁用 Top 路由专家更敏感表明冗余更低训练曲线与扩展性图 5训练基准曲线DeepSeekMoE 16B 与 DeepSeek 7B (Dense) 在训练过程中的各基准表现对比训练动态上 MoE 以更少计算量在多数任务持平或超越稠密模型13.3B 总参数 DeepSeekMoE 显著超越 19.8B 的 GShard×1.52B 已接近 Dense×16 的理论上限性能。从 2B 到 13B 再到 16B架构优势随规模保持一致。结果对比总结图 10结果对比2B Pile 1.867→1.80840% 计算量匹敌 7B28.5% 计算量可比 67BMermaid 流程图专家特化深度分析三个实验一致证明 DeepSeekMoE 的专家特化度显著高于 GShard冗余度更低禁用 Top 路由专家时 DeepSeekMoE 比 GShard×1.5 更敏感每个路由专家更不可替代共享专家不可替代禁用共享专家后 Pile Loss 从 1.808 跳升至 2.414即使保持相同计算成本知识获取更高效仅激活 4 个路由专家即达到与 GShard 相当的 Pile Loss从零训练的半激活版本1 共享 3 路由专家仍超越 GShard。图 6知识获取效率仅激活 4 个路由专家DeepSeekMoE 即达到与 GShard 相当的 Pile Loss图 7半激活对比相同总专家参数、仅一半激活专家参数从零训练的 DeepSeekMoE 仍超越 GShardSFT 对齐方面1.4M 双语样本、batch size 1024、8 epochs 训练后DeepSeekMoE Chat 16B 在 HumanEval 与 MBPP 上显著超越 LLaMA2 SFT 7B 和 DeepSeek Chat 7B多选任务仍是短板与注意力参数偏少0.5B vs 2.5B一致。关键发现组合灵活性爆炸式提升细粒度切分把激活专家组合数从 $C_{16}^2120$ 提升到 $C_{64}^8\approx 4.4\times10^9$40% 计算量匹敌 7B 稠密模型DeepSeekMoE 16B 对比 LLaMA2 7B 仅用 39.6% 计算量即多数基准超越2.5 倍推理加速16B 模型部署于单张 40GB GPU 无需量化推理速度达 7B 稠密模型的 2.5 倍63% 知识密集型优势TriviaQA 上 2B 模型比 GShard 领先 63%16.6 vs 10.2 EM共享专家不可替代禁用共享专家后 Pile Loss 从 1.808 恶化到 2.41428.5% 计算量可比 67B145B 初步探索仅用 28.5% 计算量即可比 DeepSeek 67B半激活版用 18.2% 仍超越 GShard 137B。局限性注意力参数偏少16B 模型仅 0.5B 注意力参数vs 7B 稠密的 2.5BMMLU、CEval 等多选任务表现受限规模验证有限仅验证到 145B245B tokens未涉及 DeepSeek-V2/V3 级别的超大规模训练依赖显式均衡仍需负载均衡损失控制路由坍塌无法完全依赖自动学习从零训练成本高每个配置需独立从头预训练未探索跨规模迁移或知识蒸馏。作者展望DeepSeekMoE 可作为更大规模 MoE 模型如 DeepSeek-V2/V3的架构基础细粒度切分与共享隔离的思想可推广至多模态与跨语言场景。常见问题FAQDeepSeekMoE 和 GShard 的核心区别是什么GShard 用 top-2 路由激活 2 个大专家专家粒度粗、知识混杂严重DeepSeekMoE 把专家拆成 4 倍数量的更小专家并激活更多个同时隔离出始终激活的共享专家在相同参数与计算量下大幅提升专家特化度。为什么细粒度专家切分有效细粒度切分让每个 token 可以在约 44 亿种组合中选择专家子集传统方案只有 120 种不同知识类型更容易被分配到不同的专门专家中学习专家内部参数利用率显著提升。共享专家有什么作用共享专家始终激活专门捕获所有 token 共需的通用知识避免每个路由专家都重复存储通用知识造成冗余。实验显示禁用共享专家后 Pile Loss 从 1.808 恶化到 2.414说明其不可替代。DeepSeekMoE 16B 需要多大算力部署单张 40GB GPU 即可部署无需量化推理速度达 7B 稠密模型的 2.5 倍训练与推理的 FLOPs 仅为同性能稠密模型的约 40%。DeepSeekMoE 与后续 DeepSeek-V2/V3 的关系DeepSeekMoE 是 DeepSeek 专家特化路线的奠基工作DeepSeek-V2 采用 MLA DeepSeekMoE 架构DeepSeek-V3 进一步扩展到 671B 参数细粒度切分与共享隔离思想被 Mixtral 8x7B 等开源模型跟进。为什么 MMLU 等多选任务表现偏弱16B 模型的注意力参数仅 0.5B远少于 7B 稠密模型的 2.5B注意力容量限制了需要全局知识关联的多选任务表现这是 MoE 架构当前的固有取舍。参考链接DeepSeekMoE arXiv 论文页2401.06066DeepSeek-MoE 官方 GitHub 仓库含 16B 开源权重GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding (ICLR 2021)Switch Transformer: Scaling to Trillion Parameter Models (JMLR 2022)LLaMA 2: Open Foundation and Fine-Tuned Chat ModelsDeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表