基准测试方法
经过验证的基准测试方法使用 NVIDIA GenAI-Perf 为“ 经过验证的模型” 部分中描述的每个模型生成大量推理。
单节点和多节点负载均衡方案,如 经过验证的推理流中所述。
所有测试场景均按照以下步骤完成:
- 使用 GenAI-Perf 生成来自客户端主机的基准推理请求,直接到 MI300X 推理服务器或 Envoy 负载均衡器。
在生成基准推理请求时,调整了以下参数以提取最佳性能,并收集了以下推理指标:
表 11:GenAI-Perf 推理请求参数。
参数 描述 并发 基准测试期间生成的同时推理请求或活动请求流的数量。增加并发性有助于评估推理服务在更高需求下的表现。 请求数 基准测试运行期间生成的推理请求总数。此值确定用于计算性能指标的测试样本的大小。 输入序列长度 (ISL) [tokens] 发送到推理服务的每个请求或提示中包含的输入令牌数。 输出序列长度 (OSL) [tokens] 模型在每个响应中生成的输出令牌数。 热身 在测量的基准测试运行开始之前发送的初始请求数。这些请求不包括在最终报告的性能结果中。预热有助于减少启动行为、模型初始化、缓存和其他瞬态条件的影响。 ISL 表示提示大小,而 OSL 表示生成的响应大小。通常,较大的 ISL 值会增加模型在生成第一个令牌之前必须处理的输入量,而较大的 OSL 值会增加响应期间产生的生成输出量。
- 收集并分析 GenAI-Perf 生成的推理性能指标
包括以下推理性能指标:
表 12.推理性能指标
| 类别 | 度量 | 描述 |
|---|---|---|
| 响应能力 | 第一个代币 (TTFT) 的时间 | 以毫秒为单位进行测量。请求提交和第一个生成令牌之间的经过时间。表示感知到的响应能力和交互式用户体验。 |
| 响应能力 | 首次输出时间 (TTFO) | 以毫秒为单位进行测量。请求提交与客户端收到的第一个输出之间的经过时间。对于流文本生成,这通常与 TTFT 密切相关。 |
| 请求延迟 | 请求延迟 | 以毫秒为单位进行测量。从请求提交到响应完成的总耗时。捕获面向用户的完整响应时间。 |
| 流媒体性能 | 秒令牌时间 (TTST) | 以毫秒为单位进行测量。请求提交和第二个生成的令牌之间的经过时间。帮助描述返回第一个令牌后的早期流式处理行为。 |
| 流媒体性能 | 令牌间延迟 (ITL) | 以毫秒为单位进行测量。响应流式处理期间生成的输出令牌之间的延迟。指示响应平滑度和令牌生成一致性。 |
| 吞吐量 | 每秒输出令牌数 (TPS) | 以每秒令牌数为单位。系统生成输出令牌的速率。衡量聚合推理吞吐量和服务效率。 |
| 吞吐量 | 每个用户每秒输出的令牌数 | 以每位用户每秒的令牌数来衡量。每个并发用户或请求流所经历的平均输出令牌生成速率。 |
| 吞吐量 | 请求吞吐量 | 以每秒请求数为单位。系统每秒完成的推理请求数。指示服务在基准负载下可以处理的请求数。 |
测试结果如下 使用 HPE 瞻博网络 QFX 交换机、Apstra Data Center Director 和 AMD Instinct MI300X GPU 进行推理的 AI 数据中心前端交换矩阵 -瞻博网络验证设计 (JVD) 测试报告