众所周知,大模型训练的核心瓶颈是算力。但当GPU集群规模从几十卡扩展到上千卡,一个容易被忽视的问题开始浮出水面:GPU的大量时间,其实在等数据。
分布式训练的基本逻辑是将模型切分到多张GPU上并行计算,每张GPU完成本地计算后,需要与其他GPU交换梯度数据。这个过程叫做All-Reduce,是分布式训练中最频繁的操作。当GPU算力越来越强,单次前向和反向传播的计算时间被大幅压缩,但GPU之间的数据交换速度并没有同步提升。结果就是:越强的 GPU,等待数据的时间占比越高。
这就是AI基础设施领域常说的 "网络墙" 问题。算力的边际提升已经非常成熟,但网络I/O正在成为制约集群训练效率的实际瓶颈。

传统的网络通信路径是:GPU显存 →CPU内存 → 操作系统网络协议栈 → 网卡 → 网络。这条链路的问题在于,每一次数据搬运都要经过CPU和操作系统内核,而CPU的处理速度和内核协议栈的开销,远远跟不上GPU的吞吐需求。
RDMA(远程直接内存访问)技术的核心思路是绕过CPU和操作系统,让网卡直接读写本机应用内存。对于AI训练场景,网卡可以直接读写本机GPU显存,消除本机侧CPU内存拷贝开销;数据通过网络传输到达对端服务器后,再由对端网卡直接写入对端本机GPU显存。
NVIDIA推出的GPU Direct RDMA进一步将这个思路推到极致:网卡通过PCIe总线直接访问本机GPU显存,无需经过系统内存。千卡级别的训练集群中,对比传统数据转发路径,GPU Direct RDMA能够显著降低All-Reduce通信延迟,有效提升集群整体训练效率。

GPU Direct Storage则解决了另一个瓶颈:训练数据的加载。传统方式下,存储设备中的训练数据需要先加载到CPU内存,再拷贝到GPU显存。GPU Direct Storage允许NVMe存储的数据绕过CPU内存,直接写入本机GPU显存,大幅缩短从数据读取到模型训练的通路,该能力与网卡本身无关。
以上两项能力的落地前提保持一致:网卡必须支持高性能RDMA,并且具备足够低的硬件延迟。
为什么是25G而不是10G或100G?这个问题在数据中心网络架构领域已经有比较明确的共识。
10G网卡在高密度虚拟化环境中已经开始吃力。单台服务器运行数十个虚拟机实例时,10G带宽往往被迅速打满,成为性能瓶颈。而100G网卡虽然带宽充裕,但对服务器 PCIe槽位和交换机端口密度的要求较高,在中等规模部署中性价比并不理想。
25G恰好处于一个效率甜点。PCIe 4.0 x8的带宽能力足以支撑双口25G合计 50Gbps的流量,无需占用PCIe x16全宽槽位,为GPU和其他扩展卡预留硬件安装空间。对于采用Spine‑Leaf架构的数据中心,25G接入层配合100G骨干层的组合,可以在成本和性能之间取得最优平衡,更加适配中小规模AI集群、虚拟化、分布式存储等业务场景;千卡级超大规模AI训练集群,行业主流普遍采用100G及以上接入速率。
更关键的是,25G SFP28插槽物理形态与10G SFP插槽相互兼容,硬件插槽可以复用。从 10G升级至25G,需要同步更换网卡、接入交换机以及25G光模块,部分符合高速标准的布线可以继续沿用,以此降低改造工作量。
在信创推进过程中,网卡环节长期是一个隐性短板。整机厂商可以基于飞腾、鲲鹏、龙芯组装服务器,操作系统有银河麒麟和统信UOS,但在高速网卡层面,大量方案仍然依赖Intel、Mellanox等海外芯片。
这种 "组装式国产化" 在办公场景下尚可运转,但在AI训练、高性能计算等对网络延迟和吞吐极为敏感的场景中,网卡芯片的自主性直接影响整体系统的可控程度。
光润通基于自研G-810-2SZ以太网控制器推出的 FF-2502E-GZ 25G双光口网卡,是目前国产方案中值得关注的选项。这款网卡采用PCIe 4.0 x8接口,双 SFP28光口各支持25Gbps链路速率,硬件层面提供RDMA支持,兼容GPU Direct RDMA 能力,使GPU集群训练中的数据交换可以规避本机CPU内存拷贝开销。
在无损网络方面,FF-2502E-GZ硬件支持PFC(基于优先级的流量控制)、ECN(显式拥塞标记),配合主机侧DCQCN 拥塞控制算法,共同构成构建RoCEv2 无损以太网络的核心能力。PFC在接收端缓冲区即将溢出时,仅暂停特定优先级的流量而非全部流量;ECN在IP报文头中标记拥塞信号而非直接丢包;DCQCN运行于主机侧,将二者能力结合,实现拥塞的提前感知和速率的动态调整。三者协同,保障高吞吐场景下的低延迟传输。
值得关注的是,这款网卡提供灵活的硬件卸载能力,可支撑上层部署PCC可编程拥塞控制协议与自定义RTT算法。传统网卡硬件拥塞控制策略固化,难以针对业务做深度调优;依托网卡提供的硬件基础,PCC可根据实际业务反馈动态调整发送速率,在AI训练、分布式存储这类对延迟特征有特殊要求的业务中,给到业务侧更大的调优空间。
在安全能力上,FF-2502E-GZ集成了IPSec、TLS和ACL的硬件卸载功能。IPSec 加解密和TLS密钥运算由网卡硬件完成,不占用CPU算力。对于需要加密传输的训练数据和模型参数,硬件级加密确保了安全性不以性能为代价。
全栈国产化适配方面,该网卡已适配飞腾、鲲鹏、龙芯、申威、海光等国产CPU平台,以及银河麒麟、统信UOS、中科方德等国产操作系统,同时兼容CentOS、Ubuntu等主流Linux发行版。
一张网卡的能力再强,也只是系统中的一个节点。网络瓶颈的化解,需要网卡、交换机、无损网络配置、驱动协议栈整套系统协同,并非依靠单张网卡就可以彻底解决。光润通自研芯片网卡提供全速率(1G/2.5G/10G/25G/100G)的基础连接能力,在信创从 "单品替代" 走向 "全栈闭环" 的当下,网络底座的国产化需要的不只是网卡本身,而是从芯片、驱动、协议栈到上层应用的完整协同。
在AI算力基础设施加速建设的背景下,国产高速网卡的意义不仅是替代进口,更是为国产GPU集群提供一个真正自主可控的网络底座。当算力、存储、网络三个环节都实现了国产化闭环,AI训练集群才能在性能、安全和供应链三个维度上同时站住脚。
网络不应该成为AI训练的瓶颈。国产25G高速网卡,正是补齐算力网络底座拼图的关键一环。