多节点(负载均衡)推理

在多节点负载均衡推理中,GenAI-Perf 将推理请求发送到 Envoy 端点,而不是直接发送到 MI300X 推理服务器。然后,Envoy 将请求分发到运行模型服务端点的可用 MI300X 推理服务器。请求到达推理服务器后,SGLang 路由器将其分发给本地 GPU 支持的工作线程,如单节点推理流中所述。

这种模式代表了一种生产风格的推理部署模型,其中用户或应用程序访问单个前端服务端点,而推理容量分布在多个服务器上。

在图 4 所示的示例中,GenAI-Perf 使用 IP 地址 10.10.1.34 在 Lambda Scaler 2 上运行,并使用 IP 地址 10.10.1.28 向在 Lambda Scaler 1 上运行的 Envoy 发送流量。Envoy 前端端点侦听目标端口 8000。收到请求后,Envoy 会将请求转发到其中一台 MI300X 推理服务器。

该图显示了 Envoy 将流量转发到两个推理服务器:

MI300-01 使用目标地址 10.10.5.25 和目标端口 30000。

MI300-02 使用目标地址 10.10.6.27 和目标端口 30000。

在此模式下,MI300X 推理服务器看到的源地址是 Envoy 主机。这允许基准客户端以单个前端端点为目标,而 Envoy 则在推理服务器之间执行请求分配。

表 8:多节点(负载均衡)推理摘要

字段 示例/用途
原文 GenAI-Perf 客户端主机
源地址示例 10.10.1.34
前端端点 Envoy 负载均衡器
特使地址示例 10.10.1.28
Envoy 前端端口 8000
后端点 运行 SGLang 的 MI300X 推理服务器
示例服务器 1 MI300-01、10.10.15.25,目标端口 30000
示例服务器 2 MI300-02、10.10.6.27,目标端口 30000
流量行为

GenAI-Perf 向 Envoy 发送请求。

Envoy 将请求转发到推理服务器。

目的 跨多个推理服务器进行横向扩展推理验证。