多节点(负载均衡)推理
在多节点负载均衡推理中,GenAI-Perf 将推理请求发送到 Envoy 端点,而不是直接发送到 MI300X 推理服务器。然后,Envoy 将请求分发到运行模型服务端点的可用 MI300X 推理服务器。请求到达推理服务器后,SGLang 路由器将其分发给本地 GPU 支持的工作线程,如单节点推理流中所述。
这种模式代表了一种生产风格的推理部署模型,其中用户或应用程序访问单个前端服务端点,而推理容量分布在多个服务器上。
在图 4 所示的示例中,GenAI-Perf 使用 IP 地址 10.10.1.34 在 Lambda Scaler 2 上运行,并使用 IP 地址 10.10.1.28 向在 Lambda Scaler 1 上运行的 Envoy 发送流量。Envoy 前端端点侦听目标端口 8000。收到请求后,Envoy 会将请求转发到其中一台 MI300X 推理服务器。
该图显示了 Envoy 将流量转发到两个推理服务器:
MI300-01 使用目标地址 10.10.5.25 和目标端口 30000。
MI300-02 使用目标地址 10.10.6.27 和目标端口 30000。
在此模式下,MI300X 推理服务器看到的源地址是 Envoy 主机。这允许基准客户端以单个前端端点为目标,而 Envoy 则在推理服务器之间执行请求分配。
表 8:多节点(负载均衡)推理摘要
| 字段 | 示例/用途 |
|---|---|
| 原文 | GenAI-Perf 客户端主机 |
| 源地址示例 | 10.10.1.34 |
| 前端端点 | Envoy 负载均衡器 |
| 特使地址示例 | 10.10.1.28 |
| Envoy 前端端口 | 8000 |
| 后端点 | 运行 SGLang 的 MI300X 推理服务器 |
| 示例服务器 1 | MI300-01、10.10.15.25,目标端口 30000 |
| 示例服务器 2 | MI300-02、10.10.6.27,目标端口 30000 |
| 流量行为 |
GenAI-Perf 向 Envoy 发送请求。 Envoy 将请求转发到推理服务器。 |
| 目的 | 跨多个推理服务器进行横向扩展推理验证。 |