智云时代 NVIDIA Partner

ConnectX 网卡怎么选?EDR/HDR/NDR 速率与型号全解读

技术文章

来源:智云时代
按集群规模、端口数、PCIe 平台与配套交换机,系统讲清 EDR、HDR、NDR 速率和 ConnectX 网卡的选型逻辑。
ConnectX 网卡怎么选?EDR/HDR/NDR 速率与型号全解读

一句话回答

选 ConnectX 网卡,先定速率(EDR 100G / HDR 200G / NDR 400G,按集群规模),再定端口数(单/双端口),再对型号命名解码确认接口和散热,最后核对服务器 PCIe 平台兼容性。NVIDIA/迈络思(Mellanox)ConnectX 系列中,ConnectX-7 是当前 AI 训练的主流旗舰,ConnectX-6 是性价比之选。

速率是选型的第一决策项,它直接决定单卡带宽上限:

速率 | 单端口带宽 | 适合场景 EDR 100G | 100 Gbps | 存量系统扩容、预算有限的入门集群 HDR 200G | 200 Gbps | 64 节点以内的中型集群(实测约 190Gbps) NDR 400G | 400 Gbps | 128 节点以上或规划扩展的中大型集群(实测约 380Gbps)

经验法则:64 节点以内 HDR 够用,128 节点以上直接 NDR。注意"省网卡"的代价:以 8 卡 H800A 节点为例,标配 8 张 NDR-400 网卡(单节点出网带宽 3.2Tbps),如果降到 4 张,带宽立刻腰斩到 1.6Tbps,训练性能会明显受损。为省预算降配网卡,本质是在积累技术债务。

NVIDIA/迈络思(Mellanox)ConnectX 系列按代际划分:

型号 | 最高速率 | 接口 | 定位 ConnectX-5 | 100G | PCIe Gen3/Gen4 | 生命周期尾端,存量兼容 ConnectX-6 | 200G | PCIe Gen4 | AI/企业云性价比之选 ConnectX-7 | 400G | PCIe Gen5 x16 | 当前旗舰,AI 训练首选 ConnectX-8/9 | 800G | PCIe Gen6 | 新一代,面向下一代集群

ConnectX-7(MCX75310AAS-NEAT)规格要点: · 400Gb/s NDR InfiniBand(默认)+ 400GbE 双协议,一卡两用 · PCIe Gen5 x16,双向带宽 128GB/s,向下兼容 Gen4/Gen3 · 硬件安全:Secure Boot、Inline IPsec/TLS/MACsec(AES-GCM 128/256-bit) · 高精度时钟:IEEE 1588v2 Class C,12ns 精度(金融/电信场景) · 网络内计算:SHARP 集合通信卸载、NVMe-oF 卸载 · 虚拟化:SR-IOV、VirtIO 加速

第三步:学会解码型号命名

NVIDIA 网卡型号看似复杂,其实有严格规律。以 MCX75310AAS-NEAT 为例逐段拆解:

段 | 含义 | 本例 MCX | Mellanox ConnectX 系列 | — 7 | 第几代 | 第七代 5 | 端口速率(5=400G/NDR,3=200G/HDR) | 400G NDR 3 | 端口数(3=单端口,6=双端口) | 单端口 10 | 主机接口(10=PCIe 5.0 x16,08=PCIe 4.0 x16) | PCIe 5.0 x16 AA | 连接器(AA=OSFP,AS=QSFP112,AT=QSFP-DD) | OSFP NEAT | 固件/散热(NEAT=标准,HEAT=高温增强散热) | 标准固件主动散热

常见型号速查

型号 | 配置 | 总带宽 | 适用场景 MCX75310AAS-NEAT | 1×400G NDR | 400 Gbps | 标准 AI 训练集群(最主流) MCX75610AAS-NEAT | 2×200G NDR200 | 400 Gbps | 端口冗余、高带宽密度 MCX75510AAS-NEAT | 1×200G HDR | 200 Gbps | 预算受限中型集群 MCX75310AAS-HEAT | 1×400G NDR | 400 Gbps | 高温环境,增强散热 MCX623106AN-CDAT | 2×100G 以太 | 200 Gbps | 云/AI 数据中心骨干(以太) MCX653106A-HDAT | 2×200G HDR | 400 Gbps | HPC/大型 AI 训练

第四步:核对四个兼容性要素

PCIe 平台:ConnectX-7 建议搭配 PCIe 5.0 平台才能跑满 400G;装在 Gen4 插槽可正常工作但带宽受限。 连接器与线缆:400G 网卡用 OSFP 封装,配套线缆必须是 OSFP(QSFP-DD 线缆不能直接用);线缆距离按场景选 DAC(机架内 ≤3m)、AOC(跨机架 3–100m)、光模块+光纤(长距离)。 操作系统与驱动:需安装 NVIDIA 官方 MLNX_OFED 驱动栈,主流 Linux 发行版支持好,Windows 支持有限。 配套交换机:IB 网卡需搭配 IB 交换机(如 NVIDIA Quantum 系列)才能发挥低延迟、零丢包优势。

第五步:什么时候需要专业支持

网卡选型不是孤立的,它还牵涉交换机拓扑、线缆配套、固件版本、RDMA/GPUDirect 调优。以下情况建议咨询有 NVIDIA 授权资质的服务商(如智云时代,NVIDIA 认证解决方案服务商):

· 集群规模在 64 节点以上,需要设计无阻塞胖树拓扑 · 不确定服务器主板 HCL 兼容性 · 需要 GPUDirect RDMA、SHARP 等高级特性调优 · 需要全套(网卡+交换机+线缆+光模块)一体化方案

FAQ

Q1:ConnectX-6 和 ConnectX-7 怎么选? 主要看带宽需求和预算:A100 平台 200G 够用选 ConnectX-6;H100/H200 平台或规划扩展建议 ConnectX-7(400G)。注意 ConnectX-7 建议配 PCIe 5.0 平台。

Q2:单端口和双端口怎么选? 多数 AI 训练场景单端口 400G 已够;双端口适合需要链路冗余、或单机带宽密度要求高的场景。

Q3:网卡必须搭配原厂线缆吗? 建议原厂配套(LinkX 系列)。第三方模块可能出现丢包、降速、端口不识别,关键生产环境影响大。

Q4:全新正品怎么验证? 要求供应商提供原厂出货单据与 SN 码,到 NVIDIA 官方渠道验证序列号;翻新卡通常无法通过官方查询。