FineServe数据集揭示全球LLM服务负载特征
「来自arXiv的最新研究论文FineServe提出了一个细粒度的全球LLM服务负载数据集,该数据集从全球商业市场收集,覆盖多种模型和任务。通过对到达动态和令牌行为的深入分析,研究揭示了不同模型架构、规模和任务意图下的波动规律。基于这些洞察,团队开发了FineServe负载生成器,能够组合细粒度的模型感知负载,用于多模型服务平台的基准测试。该工作为路由、调度和容量规划策略的评估提供了现实基础,数据集已公开获取。」
随着大型语言模型(LLM)越来越多地以在线服务形式持续运行,如何高效地提供LLM服务已成为系统领域的关键挑战。在波动性需求下实现低延迟和高吞吐量,需要对真实世界的服务负载有深入理解。然而,现有研究往往依赖代理轨迹或粗粒度的特征描述,难以捕捉现代多模型LLM平台的异构性。针对这一缺口,来自学术界的研究团队提出了FineServe——一个从全球商业市场收集的、覆盖多模型LLM服务负载的细粒度数据集。
FineServe的核心价值在于其“细粒度”特性。与以往仅关注单一模型或聚合统计的方法不同,该数据集包含了来自真实生产环境的详细记录,涵盖了不同架构(如Transformer变体)、不同规模(从数十亿到数千亿参数)以及不同任务意图(如对话、代码生成、翻译等)的LLM服务请求。这种多样性使得研究人员能够首次以如此精细的视角审视LLM服务负载的全局特征。
基于FineServe数据集,研究团队进行了全面的分析,重点关注两个关键维度:到达动态和令牌行为。到达动态分析揭示了不同模型和任务在请求到达模式上的显著差异。例如,某些轻量级模型可能表现出更平稳的到达率,而大型模型则可能因用户特定需求而出现突发性高峰。令牌行为分析则进一步深入到每次请求的输入和输出令牌序列长度、分布以及时间相关性。研究发现,不同任务对令牌生成模式有着根本性影响:对话任务往往具有较短的输入但可能产生较长的输出,而代码生成任务则可能呈现完全不同的令牌分布。
这些发现直接挑战了以往服务负载建模中“一刀切”的假设。例如,传统的泊松到达模型或简单的令牌长度分布假设,在多模型、多任务的真实环境中往往失效。FineServe的分析表明,需要采用更复杂的模型来捕捉不同“波动体制”之间的切换。这些体制不仅与模型本身相关,还与用户行为、时间周期以及任务类型紧密耦合。
为了将研究成果转化为实用工具,团队开发了FineServe负载生成器。该生成器能够从FineServe数据集中提取细粒度的模型感知负载模式,并将其组合成可配置的混合工作负载。这意味着研究人员和工程师可以针对特定场景(例如,模拟一个同时服务聊天机器人和代码助手平台)生成逼真的基准测试负载。这种能力对于评估路由策略(如何将请求分配给不同模型)、调度算法(如何在GPU等资源上安排请求执行)以及容量规划(如何预测并配置足够计算资源)至关重要。
FineServe的发布为LLM服务系统领域提供了一个宝贵的公共基准。通过公开数据集和生成器,研究社区可以更公平地比较不同系统设计方案的有效性。未来,该工作有望推动更高效、更鲁棒的LLM服务平台的发展,特别是在处理高度异构和动态变化的真实世界负载时。研究团队表示,将继续扩展数据集,纳入更多模型类型和新兴应用场景,以保持其时效性和代表性。
来源:Heooo AI工具导航