ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

万卡集群组网实战:迈络思网卡与线缆选型、授权直供及验收排错指南

万卡集群组网实战:迈络思网卡与线缆选型、授权直供及验收排错指南 这两年只要聊AI算力躲不开的一个词就是万卡集群。我自己经手的项目里服务器采购反而没那么让人头疼真正让人睡不着觉的是组网一万张加速卡要连成一张网光网卡、线缆、交换机这一层就能让预算和技术方案完全变样。在万卡集群组网这个场景里迈络思Mellanox现在叫NVIDIA Networking的网卡和配套线缆几乎是天天碰见的东西而经销商授权直供这件事又是很多团队第一次接触时会犯迷糊的地方。这篇文章就围绕我实际落地项目里的几个关键决策点聊聊网卡线缆怎么选、渠道怎么把关、上架之后又该怎么验收排错。1. 万卡集群到底在压什么规模、拓扑与网络采购的突然升级1.1 万卡不是一万个GPU而是数百台服务器之间的强耦合网络很多人听到万卡集群第一反应是GPU很贵、算力很强但真正参与过建设的人会告诉你GPU堆到一定规模网络就从配角变成了主角。以一万张GPU计算按主流8卡服务器来算就是1250台计算节点。这些节点不可能像单机一样通过总线互联它们之间的数据交换完全依靠网卡和交换机。大模型训练基本都是同步并行每一轮迭代都要做梯度同步跨节点通信的延迟和带宽直接决定整个训练任务跑得快不快。也就是说网络性能就是算力的一部分网络不达标GPU再快也白搭。万卡集群组网里网卡和线缆不是按块和根来买的而是按批次和柜来规划的。计算节点、存储节点、管理网络都要插网卡一张卡通常带一到两根线缆整个集群下来几千块网卡、上万根线缆是常态。量一大采购方式就必须变不能再像实验室那样零买而是要找有原厂授权的经销商走直供流程保证供货批次稳定、型号统一、售后可追溯。这也是线缆设备经销商这个角色在万卡项目里特别重要的原因。1.2 为什么这种局面下迈络思几乎成了绕不开的选择迈络思这个名字老HPC圈子的人太熟了。它后来被NVIDIA收购现在官方叫NVIDIA Networking但国内渠道和运维圈子里很多人还是习惯叫迈络思。在万卡集群里它出现频率高不是因为垄断而是因为两条技术路线里它都是主力玩家。一条是InfiniBand路线。IB从设计之初就是为高性能计算服务的无损网络、RDMA、credit-based流控这些机制在大规模并行训练里有着天然优势。另一条是RoCE路线也就是在以太网上实现RDMA可以复用通用IT技术栈成本相对低但调优复杂度高。NVIDIA把网络产品和GPU生态深度绑定之后训练框架对IB的适配越来越成熟很多万卡项目干脆全链路走IB图的就是稳定和性能可预期。实际接触项目会直观感受到客户提需求时点名迈络思 IB网卡的频率远高于任何其他品牌。这一点已经决定了后续选型、采购、排错的整个工作范围。1.3 网卡和线缆的数量级估算预算和工期都藏在这些数字里我把一个典型万卡训练集群的网络硬件量拆给大家看。计算网络1250个计算节点每个节点按2块200G或400G网卡设计就是2500块网卡对应2500根线缆起步还要留备件。存储网络高性能存储集群如果走IB或RoCE需要再额外采购几百块网卡和相应线缆。管理网络看起来不起眼很多项目上架时才想起来管理口不够用临时加千兆电口模块非常被动。交换层面就更直观了以两层fat-tree为例每个计算节点的2个网卡分别接leaf交换机。如果leaf用64口交换机2500个网卡口就需要大约40台leafspine的数量再按收敛比和带宽冗余要求叠加。整个过程算下来你会明白为什么成熟的集成商会建议你从经销商那锁定整批货源——临时拼凑和分批采购型号批次不一致后续运维会多出很多麻烦。2. 迈络思网卡选型别只盯着速率先想清楚协议和端口2.1 协议路线先于速率IB和RoCE是两条不同的河网卡选型落地时我通常第一步不是看速率而是确认协议路线。这决定了你买回来的卡插在什么交换机上、跑什么网络栈、用什么运维工具。维度InfiniBandRoCE以太网设计初衷高性能计算专用协议在以太网上实现RDMA拥塞控制原生无损credit-based流控依赖PFC、ECN手动调优生态适配训练框架适配成熟开箱即用通用IT团队更熟悉但需要额外配置采购成本整体方案偏贵相对便宜可复用以太网运维经验典型场景规模化AI训练、HPC确定性性能AI与传统业务混部、IT预算受限如果你的项目必须在一万张GPU规模上跑同步训练且对训练中断时间极度敏感我会建议走IB。RoCE不是不行而是团队必须有能力处理PFC风暴、ECN调参这类问题否则链路一拥塞训练性能立刻给你脸色看。2.2 核心型号和接口参数看懂命名就知道自己需要什么选定协议路线后再来看具体网卡型号。迈络思现在主流的几代产品参数区别挺大采购前一定要对着服务器的PCIe版本选。型号系列接口速率端口形态主机接口备注ConnectX-6 HDR200G HDRQSFP56有单口和双口版本PCIe 4.0 x16成熟稳定存量方案多ConnectX-7 NDR400G NDRQSFP-DD 或 OSFPPCIe 5.0 x16新款旗舰适合新集群ConnectX-7 HDR200G HDRQSFP56双口PCIe 5.0 x16双口密度高单卡两路BlueField-3200G/400GQSFP-DDPCIe 5.0 x16带DPU卸载能力适合存储虚拟化选型时最容易踩的两个坑我单独说。第一只看了速率没看协议和端口形态。200G的IB卡和200G的RoCE卡不是一回事外形可能都是QSFP56但固件、驱动、交换机兼容性完全不同。买到手才发现连不上退货周期会拖慢整个项目。第二没核对服务器PCIe代际。老服务器如果只有PCIe 3.0或PCIe 4.0的槽位插一张PCIe 5.0的400G网卡带宽会受限于槽位版本实际跑不到标称速率。我见过有项目为了省服务器成本用老平台插New卡结果性能测试直接腰斩。选型时务必先拿到服务器主板型号查清PCIe槽位版本和可用宽度。2.3 单口、双口、DPU万卡场景里的决策逻辑单口和双口的选择不是简单的口多就好。双口网卡在一块卡上提供两个物理端口可以接两个leaf交换机实现冗余或带宽叠加机箱槽位占用少。但双口卡在驱动层面相当于两个独立HCA设备配置工作量翻倍而且如果一张卡故障两个端口同时失效冗余逻辑要特别注意。单口卡的优势是故障域隔离更清晰但一台服务器要接两个leaf就得插两块卡占用两个PCIe槽位。GPU服务器里槽位本来就紧张CPU、GPU、存储控制卡都在抢选型时要提前数清楚槽位。BlueField系列带DPU等于把网络、存储、安全这些功能从CPU上卸载下来。万卡集群里如果还想跑高性能存储或需要做网络虚拟化DPU很值得考虑但它对软件栈的要求更高学习成本摆在那。我一般建议纯训练集群用标准ConnectX卡就够了只有在存储网络或需要大量卸载场景时才考虑BlueField别为了听起来高级把复杂度引进来。3. 线缆才是组网里最容易被低估的环节3.1 DAC铜缆、AOC有源光缆、光模块距离决定选型网卡旁边那根线看起来不起眼但万卡集群里它是最容易被低估的物理层。线缆选错链路起不来后面所有调试都是白搭。我按传输距离把线缆分成三类给出适用场景。类型常见速率传输距离功耗与成本适用位置DAC直连铜缆200G/400G最长3米到5米机柜内短距离低功耗、成本最低同机柜或相邻机柜服务器到leafAOC有源光缆200G/400G最长可达几十米列间/跨机柜中等功耗、成本更高不同机柜之间到汇聚光模块光纤400G几十米到几百米以上跨楼层/跨机房功耗高、需要单独光模块预算核心交换互联、跨机房链路实际项目里有个经验法则能走DAC的地方优先走DAC。短距离铜缆的功耗最低故障点最少插上就能用延迟表现也更好。只有跨机柜、跨列或跨机房时才升级到AOC或光模块。有些集成商喜欢全都推光缆理由是省得到时候再换但光缆的故障率和运维成本其实更高尤其是机房环境里光纤头脏污导致的信号问题排查起来很头疼。3.2 线缆与网卡端口的匹配接头、码值和认证线缆除了距离线缆和网卡端口的物理匹配也经常出事。QSFP56、QSFP-DD、OSFP这几种接口形态虽然都叫光模块接口但尺寸和电气定义不一样不能混插。还有一类常被忽略的是breakout线缆。比如400G网卡可以通过一根1分4的线缆分出4个100G端口接到不同交换机上。这个方案在带宽利用率上很灵活但采购线缆时必须确认网卡支持的分线模式否则插上去只能认到一个端口。不同代际的网卡对breakout的支持情况不一样选型时直接查官方规格说明最稳。NVIDIA官方有Cable and Transceiver兼容性列表线缆和光模块兼容矩阵这个文档一定要在项目启动时就拉出来看。第三方线缆虽然便宜但固件不兼容导致链路协商失败的事情我在数据中心里遇到不止一次。按兼容矩阵选线缆和模块上架后能少掉八成物理层问题。3.3 从线缆已拔出、网卡灯不亮看一个真相物理层的锅比网卡大网上搜索ubuntu 虚拟机 网络 线缆已拔出网卡灯不亮网线确认是通的这类问题的人特别多很多用户第一反应是网卡坏了。其实在数据中心里这个排查直觉错得很普遍。链路显示down真正的原因往往是线缆或模块那一层。我总结过最常见的几个物理层故障光口防尘帽没拔掉。听起来很低级但新开箱设备里我碰到过不止一次。DAC接头没插到底或者卡扣没锁住。IB卡和交换机端口都有卡扣设计没卡紧时外观看着是插上了实际电气接触不良。光模块的码值和网卡不匹配链路训练失败。线缆长度超过设计距离信号劣化严重但表面看不出问题。排错时如果只盯着网卡很容易绕远路。正确做法是先看链路状态工具再逐段替换线缆或模块最后才怀疑网卡本身。物理层问题用替换法定位是最快的成本也最低。4. 经销商授权直供渠道值钱在可验证的确定性4.1 为什么万卡采购必须认授权直供而不是便宜就行万卡集群不是买几块网卡自己测试玩它是上千块卡、上万根线的批量采购任何一个环节出问题影响的都是整个训练任务的交付时间。授权直供的意义表面看是货来自原厂渠道本质上买的是三样东西保修可兑现、批次可追溯、交期可预期。拆机卡或翻新卡最坑的地方不在外观而在固件和序列号。有些拆机卡固件被刷过非官方版本链路不稳定重启后偶尔掉卡有些翻新卡的SN已经无法在原厂系统里注册保修一旦出问题不管是换货还是维修都无从谈起。数据中心里一块网卡故障不只是一块卡的事可能让一个训练任务中断重来损失远超卡本身的价格。4.2 怎么判断一个渠道是不是真有授权四步核验法第一步上NVIDIA官网查合作伙伴或授权经销商名录确认对方公司名称在列表里。第二步要求对方提供当年度原厂授权证书或授权函并且授权范围要覆盖数据中心网络产品线不只是一句我们做迈络思。第三步报价单必须写清楚完整型号、原厂保修条款、供货周期并注明原厂直供。第四步到货后逐张核对序列号把这些SN拿去官网或原厂客服核验保修状态。这四步走完基本能把绝大多数非正规渠道排除掉。有人觉得麻烦但万卡项目里这个环节省不了。4.3 直供采购流程和我自己踩过的坑正规直供流程一般是把型号和数量清单发给经销商让他们按原厂价格表出RFQ确认lead time网卡一般几周到一个月线缆种类多了可能要更久项目计划必须留足buffer到货后先开箱验货抽检几块网卡连机验证别急着全部上架采购单据和序列号登记表要归档保留后续保修换货全靠它。过程中有两个常见坑。一个是交期承诺过短。很多渠道没有原厂排期就在报价单上写两周到货到了时间交不出来项目全卡住。正规直供渠道会告诉你真实排期并且愿意把供货周期写进合同。另一个是报价明显低于市场价。网卡这类标准化硬件的价格是透明的低太多只有两种可能拆机翻新或者后续在质保条款上做文章。贪便宜吃大亏在万卡项目里特别适用。5. 从采购到上架网卡识别不到、虚拟化不认卡这类问题怎么排5.1 新卡上架后识别不到先看设备再看驱动最后查固件采购环节理顺了硬件到了机房真正的排错才刚刚开始。网卡插进服务器后识别不到是我见过最多的首日报道单。排错顺序很重要我一般按下面这个链路走。先在系统里确认设备是否存在lspci | grep -i Mellanox mst status如果lspci能列出设备但执行ibstat时提示找不到设备问题大概率在驱动或固件层。安装MLNX_OFED驱动时一定要确保驱动版本、操作系统内核和网卡固件三者相互匹配。NVIDIA官方文档里每种驱动版本都标注了对应的内核和固件范围别用太新的驱动硬配老固件。如果mst status里根本看不到设备优先怀疑物理安装断电重新插拔网卡确认PCIe槽位没问题然后进BIOS检查PCIe资源分配和Above 4G Decoding这类设置是否开启。依次做完再考虑网卡本身是否故障。5.2 虚拟化场景里的没有网卡ESXi不认卡、虚拟机看不到网卡网上常搜ESXi安装提示没有网卡虚拟机安装没有虚拟网卡这种问题在数据中心也不少见而且和消费级场景里虚拟网卡不存在或被禁用的排查思路是相通的先确认物理层再查驱动最后查虚拟化层的配置。物理机装ESXi时提示没有网卡最常见原因是网卡不在ESXi的兼容性HCL列表里或者需要额外的VIB驱动。解决办法是提前查VMware兼容列表确认型号支持后再开工如果型号确实要被老版本ESXi识别需要用ESXi-Customizer这类工具注入对应驱动做成自定义镜像再安装。虚拟机里看不到网卡多半是PCIe直通或SR-IOV配置问题。PCIe直通需要给虚拟机绑定对应的物理PCI设备SR-IOV则要先把物理网卡划分出VF再在虚拟交换机和端口组里把VF分配给虚拟机。配置对了虚拟机里才能看到网卡并建立链路。数据中心环境里还有一个容易被忽略的点网卡固件版本太旧会导致VF分配行为异常表现出来就是虚拟机里链路起不来。遇到这类问题先升固件再调虚拟化配置能省很多事。5.3 万卡项目验收清单不是插上亮灯就完事最后分享一份我自己项目里用的验收清单。万卡集群的网卡验收绝不能只看到状态灯亮就认为完成了必须做链路层、诊断层、带宽层的完整检查。检查项命令/方法预期结果网卡识别mst status显示正确的HCA型号和序列号链路状态ibstat 或对应网卡工具State: ActivePhys状态为LinkUp线缆诊断iblinkinfo / ethtool -m 等线缆和模块信息可读无严重告警带宽验证ib_write_bw 或 ib_send_bw 打流实测带宽达到标称速率90%以上稳定性持续满带宽压测无CRC错误、无链路down事件压测环节很多人偷懒觉得新卡没必要跑长时间压力。我建议至少跑一整夜尤其是有大量线缆接驳的节点。万卡集群的故障模式往往不是单点立刻坏而是链路质量差、偶发丢包这种问题只有长时间打流才能暴露出来。再补一句我个人的体会。项目做到最后真正拉长工期的往往不是交换机也不是服务器而是线缆这种小东西。万卡组网里线缆种类多、用量大、易损一定要按至少5%到10%的比例准备备件网卡备件按2%到5%准备。看着是多花了钱但真到链路故障找不出替换件的时候每一根备线缆都能救整个项目的进度。
返回列表