如何验证高性能人工智能传输

IxNetwork
+ IxNetwork

从纵向扩展到横向扩展,对人工智能运输网络进行验证

现代人工智能数据中心依赖于相互连接的纵向扩展、横向扩展和跨域扩展网络,以提供大规模人工智能训练和推理所需的性能。纵向扩展互连架构通过超低延迟、高带宽的互连技术连接 pod 内的 GPU 和加速器,而横向扩展网络则通过基于无损以太网的互连架构连接机架和集群。 随着人工智能部署规模的持续扩大,“跨域扩展”架构将多个园区和人工智能工厂之间的连接进一步扩展,使组织能够构建一个作为单一系统运行的分布式人工智能基础设施。

这些不断演进的架构在吞吐量、延迟、拥塞管理、多平面和多路径转发以及互操作性方面带来了新的挑战,这些挑战必须在部署前进行验证。对于纵向扩展、横向扩展以及跨网络扩展,Keysight AI 数据中心网络测试解决方案能够大规模模拟真实的人工智能工作负载流量模式。 是德科技(Keysight)的进阶 KAI数据中心构建器(KAI Data Center Builder)能够模拟集体通信及混合集体工作负载,同时测量吞吐量、延迟、任务完成时间和带宽使用情况。这使得对交换机、网卡(NIC)、xPU和端到端互连架构进行全面验证成为可能,从而帮助客户充满信心地部署高性能AI基础设施。

人工智能交通网络的端到端验证

规模扩大

在同一Pod内,GPU和xPU通过超低延迟、高带宽的连接共享内存。NVLink/NVSwitch仍占据主导地位,而基于以太网的替代方案(如ESUN和SUE)正逐渐受到关注,UALink则通过专用加速器互连提供了另一种实现路径。 验证工作必须涵盖加速器之间的吞吐量和延迟、无损流量控制,以及在日益多样化的互连技术组合中的互操作性。

横向扩展

机架和机柜通过无损、具有拥塞控制功能的基础架构连接成一个培训集群。 以太网/RoCEv2是首选方案,而包括多路径可靠连接(MRC)、MetaRoCE和UE传输(UET)在内的新型传输协议,则通过多路径分发和更快的丢包恢复机制,提升了大规模环境下的资源利用率。验证工作必须涵盖拥塞控制调优、多路径容错能力,以及端到端吞吐量、延迟和任务完成时间。

Scale-Across

多个站点通过长距离光纤和以太网链路联合成一个系统。这一新兴且仍在形成中的类别,其发展受到广域网拥塞、距离延迟、AI任务调度以及分布式检查点等因素的影响。验证工作必须涵盖光纤链路稳定性、跨站点延迟影响,以及在真实的分布式训练条件下的流量行为。

探索我们的人工智能基础设施解决方案中的产品

联系我们 标识

联系我们的专家之一

需要帮助找到适合您的解决方案吗?