市场长期将 CUDA 软件生态视为 NVIDIA 最深的护城河,但随着 Triton 等高级抽象编译框架的普及,底层硬件软件栈正在被“屏蔽”。竞争对手通过单卡算力追赶和开源软件替代,正试图瓦解 NVIDIA 的软件壁垒,有观点认为 CUDA 或许今年就会丧失其在 LLM 中的领导地位。
据笔者观察,NVIDIA 的护城河已完成了从“芯片/软件” 向 “平台/系统” 的跃迁。借助 NVIDIA NVLink Fabric、In-Network Computing和 Vera CPU 等组件,NVIDIA 以其卓越的 scale-out 、scale-up性能,成为超大 GPU 集群的首选方案和工程标准。
一、 护城河的迁移:单卡 CUDA 到集群 Fabric 的必然性
1. CUDA 之外的选择
长久以来,开发者直接基于 CUDA C++ 编写底层算子,形成了极强的生态粘性。然而,当前 AI 的全面爆发让生态迁移成本骤降(参考 这篇博客 )。 开发者通过高层框架进行编程,工具链自动将算子下发并转换,底层芯片是否为 CUDA,对开发者来说差异越来越小。这给了 AMD (MI系列) 以及云厂商自研 ASIC 极大的突围空间。
2. 从单卡算力到集群通信
随着 LLM 参数规模的极速膨胀,AI 2.0 时代的计算核心矛盾,已经从单卡的 TFLOPS 极限,转向多 GPU 集群和 mem-fusion 网络的通信的带宽与延迟。
在运行超大规模 MoE 模型时,Token 需要频繁在不同的专家 GPU 之间进行 All-to-All 随机路由。如果集群节点间的通信延迟高,GPU 将产生大量的长尾延迟和空闲等待。
谁能构建更快的 GPU 集群,谁就掌握了 AI 基建。
二、 跨机柜 NVLink Fabric 的逆天性能
1. 硬件层面的 1:1 无阻塞扩展比(Non-blocking Scaling)
NVIDIA 维持其机柜核心溢价的基础,在于其物理网络恐怖的线性扩展能力。
- Blackwell 架构 NVLink 5:单 GPU 具备 1.8 TB/s 双向带宽,扩展到 GB200 NVL72 机柜时,通过无阻塞胖树(Fat-Tree)拓扑,整机柜物理总带宽无损达到 130 TB/s。
为了解决分布式系统的一致性通常会引入复杂的通信协议,通信的开销通常会使得扩展比降低,即 1 + 1 = 1.5 的效果,扩展比不扩展强,但比两个机柜的独立带宽之和差一点。NVIDIA 的 NVLINK 和 NVLink Fabric 在横向(机柜间)和纵向(机柜内)都实现了接近无损的扩展,非常令人震撼,堪称工程奇迹。
2. 对抗 UALink 联盟的迭代节奏
由 AMD、Intel、Broadcom、Cisco、Google、Meta、Microsoft 等组成的 UALink (Ultra Accelerator Link) 联盟试图复制 PCIe 的开放成功,推出了 UALink 1.0 和 UALink 2.0 规范,旨在联合打破 NVLink 的垄断。
然而,开放标准的软硬件生态碎片化严重,且需要多厂商长周期的利益博弈。NVIDIA 利用其一年一迭代的激进迭代,在 UALink 2.0 芯片实际量产出货前,便用技术成熟的 Rubin NVL576 锁死了最高端算力市场,让开放标准难以望其项背。
三、 In-Network Computing 极限优化的计算网络
竞争对手即使通过物理拼凑做出大集群,在实际运行大模型时的 Model Flops Utilization(MFU,模型浮点运算利用率) 也会因为通信风暴发生断崖式下跌。NVIDIA 的解法是将网络设备“计算化”。
1. NVSwitch 芯片内部的算术演进
在最新的 NVSwitch 交换机芯片 中,NVIDIA 不仅堆叠了高密度的 SerDes 接口,更直接在交换机内部集成了 ALU(算术逻辑单元),可以承担一部分计算任务。
2. SHARP 协议的计算下沉
利用 SHARP(可伸缩层级聚合与削减协议) 引擎,大模型集体通信中最核心的 All-Reduce 和 All-To-All 梯度求和与分发指令,直接在 NVSwitch 交换机内部流动的过程中完成运算,无需传输到指定 GPU 节点计算。
数据不需要跨网络返回 GPU,大幅减少了网络中的数据流量与通信延迟,突破了传统网络带宽瓶颈。这种优化是由协议、交换设备共同完成,目前只有 NVIDIA 具备这样的统治力。
四、 NVLink Fusion 的硬件平台化策略
伴随着系统架构演进,NVIDIA 推出了 NVLink Fusion 技术,允许云厂商自研的定制化 ASIC 或专用 CPU 通过标准接口(如 UCIe)直接接入 NVIDIA NVLink Fabric 中。
这打破了原有的排他性垄断形象,却建立了更深层次的依存关系:云厂商可以用自研芯片,但前提是必须采用 NVIDIA 的 NVSwitch 交换机、机柜架构和 NVLink 物理织网。 NVIDIA 由此从一个“芯片供应商”,升级为了整个 AI 数据中心基础设施的“行业母体”,NVIDIA 正实现硬件平台化。
五、 总结
后续应紧密跟踪从 Blackwell 铜缆背板向 Rubin 跨机柜硅光子切换的节奏。若上游高精度光路对准封装良率爬坡不及预期,可能会对 NVIDIA 的高密度机柜交付速度产生阶段性制约。
NVIDIA 用 NVLink Fabric 锁死了未来物理机器的边界,这道由材料学、网内计算与全栈协同筑起的系统级护城河,比 CUDA 软件更难被逆向工程或开源生态瓦解。

