
引言:当视觉模型开始“借鉴”LLM2026年1月14日,Ultralytics正式发布YOLO26,带来了一个让社区意外的技术选择——放弃使用多年的AdamW作为默认优化器,转而引入一个名为MuSGD的混合优化器。根据Ultralytics官方博客的介绍,MuSGD是一种结合SGD与Muon风格的混合优化器,其设计灵感直接来源于大型语言模型训练中的优化技术突破。这个选择背后有一个硬核的现实:YOLO26采用了端到端无NMS架构,模型必须在训练阶段就学会做出清晰、自信的检测决策,而不是依赖后处理来“纠正”预测。这对优化器提出了更高的要求——收敛要稳、训练要快、结果要可预测。AdamW在这种端到端场景下暴露出了不足:对于YOLO26这种轻量级backbone,AdamW的自适应学习率容易导致训练后期的震荡和不稳定。MuSGD的引入,本质上是把LLM训练领域积累的优化器工程经验,第一次系统性地搬到了目标检测领域。本文将从源码级别拆解MuSGD的工程实现,对比它与AdamW、SGD、原始Muon的关键差异,并结合YOLO26的实际部署场景给出实践建议。一、MuSGD架构设计:混合优化器的源码级剖析1.1 参数分组策略——哪些权重能“享受”Muon更新?MuSGD最核心的工程决策在于参数分组。根据Ultralytics官方API文档,M