技术进展

校准后路由:提升解耦LLM服务性能

Heooo 09月16日12时03分 35 阅读

「研究提出一种基于校准的请求路由策略,用于解耦式大语言模型(LLM)服务架构。该方法通过精确估计各实例的完成时间,在真实GPU集群上验证,显著提升系统吞吐量并降低延迟波动,优于轮询、最少负载等传统策略。」

在大语言模型(LLM)推理服务日益追求高效率与可扩展性的背景下,解耦式(disaggregated)架构成为热门方向。此类架构将计算密集型的预填充(prefill)阶段与内存密集型的解码(decode)阶段分离,分别部署于不同的GPU资源池中,以优化硬件利用率。然而,如何智能地将用户请求路由至合适的实例,仍是影响整体性能的关键挑战。

近日,一篇发表于arXiv的论文《Calibrate, Then Route: A Measured Study of Learned Request Routing for Disaggregated LLM Serving》对此问题进行了系统性研究。作者提出了一种“先校准,再路由”(Calibrate, Then Route)的策略,旨在更精准地预测每个请求在不同实例上的额外完成时间。该预测模型综合考虑了四个核心因素:确切的提示词长度、预测的输出长度、准入后的KV缓存压力,以及服务等级目标(SLO)类别。

研究团队首先在离散事件模拟器中开发并调优该路由策略,随后在由八块NVIDIA A40 GPU组成的实际测试平台上进行验证。每块GPU运行vLLM推理引擎,而NIXL框架负责在预填充池与解码池之间高效传输KV缓存。所有实验均在系统饱和状态下进行,使用三条具有混合负载和突发特性的到达轨迹,以贴近真实场景。

实验结果表明,经过硬件校准的路由策略在平均有效吞吐量(goodput)上达到0.864,显著优于轮询(0.835)、最少负载(0.847)以及基于长度启发式(0.841)等基线方法。更重要的是,该校准路由在不同负载轨迹下表现出最低的性能方差,展现出更强的鲁棒性。在三条测试轨迹中,它全面优于轮询和长度启发式,并在两条轨迹上胜过最少负载策略;在第三条轨迹上虽略低0.003,但该差距处于运行间噪声范围内,可视为性能相当。

研究特别强调了硬件校准的重要性。若直接使用模拟器推导的常数参数,会导致有效吞吐量下降4.5个百分点,并损失约40%的尾部延迟优势,使路由策略退化为简单的队列计数。此外,该策略的优势随解码池规模扩大和流量异构性增强而愈发明显,但在仅含三个实例的小型池中,其收益消失——此时队列长度信息已足够指导路由决策。

值得注意的是,在极端资源稀缺场景下,若采用贪婪的成本最小化策略,可能导致请求过度集中于“最便宜”的实例,反而不如盲目分散策略。而使用校准后的成本模型,该学习型路由器仅用六块GPU即可实现轮询策略在七块GPU下的吞吐性能,显著提升了资源效率。

# 大语言模型 # 推理优化 # 请求路由 # 解耦架构 # vLLM

来源:Heooo AI工具导航