验证框架
被测平台/设备 (DUT)
表 25:被测平台/设备 (DUT)
| 组件、 | 前端 | 存储、后端 | GPU 后端(集群 1 和 2) |
|---|---|---|---|
| 架构 | 3 级 Clos | 3 级 Clos | 3 级 Clos 轨道优化 |
| 主干节点 | QFX5130-32CD x 2 | QFX5220-32CD x 2 | QFX5230-64CD x 2 (群集 1) PTX-10008 JNP10K-LC1201(群集 1) QFX5240-64OD x 2 (群集 2) QFX5241-64OD x 2 (群集 2) |
| 叶节点 | QFX5130-32CD x 1 ( 前端-gpu-叶 式 ) QFX5130-32CD x 1 ( 前端-weka-leaf ) |
QFX5220-32CD x 2 (存储-后端-gpu-叶 ) QFX5220-32CD x 2 ( 存储-后端-weka-leaf ) |
QFX5220-64CD x 8(群集 1 - 条带 1) QFX5230-64CD x 8(群集 1 – 条纹 2) QFX5240-64CD x 8(群集 2 – 条纹 1-2) QFX5241-64OD x 2 (群集 2) |
| 叶节点 <=> 主干节点链路 |
2 个 400GE (每个前端叶 <=> 前端-主干链接) |
2 个 400GE (每个存储后端 weka-leaf <=> 存储后端主干 ) 3 个 400GE (每个存储后端 GPU-叶 <=> 存储后端主干 ) |
2 个 400GE (每个 GPU 后端主干 <=> GPU-后端-叶链路) |
| NVIDIA DGX 数量 H100 GPU 服务器 |
2(群集 2 - 条带 1) 2(群集 2 - 条带 2) |
||
| NVIDIA HGX 数量 A100 GPU 服务器 |
4(群集 1 - 条带 1) 4(群集 1 - 条带 1) |
||
| 英伟达 DGX H100 GPU 服务器 <=> GPU 叶节点链路 |
1 个 100GE (每个 GPU 服务器 <=> frontend-gpu-leaf link) |
1 个 200GE (每个 GPU 服务器 <=> storage-backend-gpu-leaf 链路) |
1 个 400GE(群集 2) (每个 GPU 服务器 <=> GPU-后端-叶链路) |
| 英伟达 HGX A100 GPU 服务器 <=> GPU 叶节点链路 |
1 个 100GE (每个 GPU 服务器 <=> frontend-gpu-leaf link) |
1 个 100GE (每个 GPU 服务器 <=> storage-backend-gpu-leaf 链路) |
1 x 200GE(群集 1) (每个 GPU 服务器 <=> GPU-后端-叶链路) |
| GPU 总数 | 96:群集 1 中的 32 x 条纹 群集 2 中的 16 个条带 |
||
| WEKA 存储服务器 | 8 | ||
| WEKA 存储服务器 <=> WEKA 存储叶节点链路 |
1 个 100GE (每个 WEKA 服务器 <=> frontend-weka-leaf 链接) |
1 个 200GE (每个 WEKA 服务器 <=> storage-backend-weka-leaf link) |
不适用 |