以太网支持从 10Mbps 到 800Gbps(千兆位每秒)的数据传输速率,1.6Tbps(太比特每秒)的速率即将到来。这些速度对于处理人工智能通常使用的海量数据集至关重要。
- 实时响应:低延迟对于 AI 系统至关重要。以太网可最大限度地减少延迟,确保 GPU、CPU 和存储设备等组件之间的及时交互。
- 实时决策:以太网可实现实时人工智能驱动的决策。其高带宽可确保人工智能节点之间的高效通信。
- 无损网络:传统以太网在拥塞时可能会丢包,影响 AI 模型的准确性。然而,新兴技术承诺“无损”传输,即使在高负载下也能确保数据完整性。
- 可扩展性:随着 AI 模型变得越来越复杂,可扩展的基础设施变得至关重要。以太网通过连接其他服务器和设备实现无缝扩展。以太网可适应其指数级增长,确保高效的连接和数据交换。
- 基于标准的互操作性: 对于希望最大限度发挥太比特以太网优势的人工智能应用而言,确保低延迟和无损性能至关重要。因此,泰莱克罗伊公司同时支持以下两项: 超以太网联盟 (UEC) 规范 以及IEEE标准。
- AI与UE解决方案专区:
一套专用的授权功能,提供最先进的测试功能,用于验证用于人工智能应用的超以太网。
(学到更多)
超以太网旨在满足 AI 和 HPC 环境的特殊需求,包括同步流量突发、超低延迟、快速丢包恢复以及可预测的性能,其速度最高可达 1.6Tbps(使用 224G SerDes)和 3.2Tbps(使用 448G SerDes)。
超以太网通过链路层重试、高级拥塞处理和 AI 优化的传输行为等举措增强了标准以太网的架构,以确保在真实的 AI 流量条件下具有更确定的性能。
验证用户设备 (UE) 网络需要在帧、符号和网络结构层面进行深入的、协议感知的测试。从使用 UE 特有的 LLDP 扩展进行能力发现,到局部丢包恢复和智能流控制,超以太网测试致力于确保设备在要求严苛的大规模人工智能和高性能计算 (HPC) 部署中能够正确且一致地互操作。
泰莱科瑞提供先进的硬件和软件解决方案,用于测试运行人工智能应用程序的网络所使用的超以太网。
其中包括Z800 Freya和Z1608 Edun流量生成器,它们分别使用112G SerDes和224G SerDes,能够以高达800Gbps和1.6Tbps的速度生成流量。 SierraNet M1288 协议分析仪,可实现全线速捕获和高达 800Gbps 的高级干扰功能。
除了这些设备标配的全面测试功能外,Xena AI & UE 解决方案还增加了验证支持 UEC 的交换机和 xPU 所需的 UE 特定链路层行为。这些行为包括:
-
链路层重试(LLR)
-
基于信用的流量控制(CBFC)
-
链路层协商(UE扩展的LLDP)
-
有状态UE协议控制和消息交换
-
UE错误注入、消息检查和捕获
要了解更多关于纵向扩展和横向扩展以太网架构的区别、超以太网的重要性以及如何自信地测试下一代人工智能网络的信息,请参阅
https://xenanetworks.com/ultra-ethernet-testing/
用于人工智能工作负载的数据中心架构通常采用脊叶式结构,通过低延迟的二层/三层网络基础设施,以 400-800Gbps 的端口速度连接数千个人工智能加速器和存储解决方案。基于融合以太网的远程直接内存访问 (RoCE) 是一种很有前景的存储数据传输协议。
- 数据中心桥接 (DCB):促进 RDMA 数据包(无损流量)以及常规尽力流量(有损流量)的高吞吐量、低延迟和零数据包丢失传输。
- 优先流量控制 (PFC):当缓冲区填满超过某个阈值时,通过提示发送方暂时暂停发送数据包来防止数据包丢失。
- 拥塞通知(CN):RoCEv1 和 RoCEv2 在网络设备之间实现了一种信令,可用于减少无损网络中的拥塞蔓延、降低延迟和提高突发容忍度。
- 增强流量选择 (ETS):能够为每种服务类别 (CoS) 分配最低保证带宽。