验证框架

被测平台/设备 (DUT)

表 25:被测平台/设备 (DUT)

组件、 前端 存储、后端 GPU 后端(集群 1 和 2)
架构 3 级 Clos 3 级 Clos 3 级 Clos 轨道优化
主干节点 QFX5130-32CD x 2 QFX5220-32CD x 2

QFX5230-64CD x 2 (群集 1)

PTX-10008 JNP10K-LC1201(群集 1)

QFX5240-64OD x 2 (群集 2)

QFX5241-64OD x 2 (群集 2)

叶节点

QFX5130-32CD x 1

( 前端-gpu-叶 式 )

QFX5130-32CD x 1

( 前端-weka-leaf )

QFX5220-32CD x 2

(存储-后端-gpu-叶 )

QFX5220-32CD x 2

( 存储-后端-weka-leaf )

QFX5220-64CD x 8(群集 1 - 条带 1)

QFX5230-64CD x 8(群集 1 – 条纹 2)

QFX5240-64CD x 8(群集 2 – 条纹 1-2)

QFX5241-64OD x 2 (群集 2)

叶节点 <=>

主干节点链路

2 个 400GE

(每个前端叶 <=>

前端-主干链接)

2 个 400GE

(每个存储后端 weka-leaf

<=> 存储后端主干 )

3 个 400GE

(每个存储后端 GPU-叶

<=> 存储后端主干 )

2 个 400GE

(每个 GPU 后端主干 <=>

GPU-后端-叶链路)

NVIDIA DGX 数量

H100 GPU 服务器

2(群集 2 - 条带 1)

2(群集 2 - 条带 2)

NVIDIA HGX 数量

A100 GPU 服务器

4(群集 1 - 条带 1)

4(群集 1 - 条带 1)

英伟达 DGX H100

GPU 服务器 <=>

GPU 叶节点链路

1 个 100GE

(每个 GPU 服务器 <=>

frontend-gpu-leaf link)

1 个 200GE

(每个 GPU 服务器 <=>

storage-backend-gpu-leaf 链路)

1 个 400GE(群集 2)

(每个 GPU 服务器 <=>

GPU-后端-叶链路)

英伟达 HGX A100

GPU 服务器 <=>

GPU 叶节点链路

1 个 100GE

(每个 GPU 服务器 <=>

frontend-gpu-leaf link)

1 个 100GE

(每个 GPU 服务器 <=>

storage-backend-gpu-leaf 链路)

1 x 200GE(群集 1)

(每个 GPU 服务器 <=>

GPU-后端-叶链路)

GPU 总数

96:群集 1 中的 32 x 条纹

群集 2 中的 16 个条带

WEKA 存储服务器 8

WEKA 存储服务器 <=>

WEKA 存储叶节点链路

1 个 100GE

(每个 WEKA 服务器 <=>

frontend-weka-leaf 链接)

1 个 200GE

(每个 WEKA 服务器 <=>

storage-backend-weka-leaf link)

不适用