技术进展

一年LLM服务负载演化研究发布

Heooo 08月17日12时31分 28 阅读

「一项基于Chutes平台为期一年的真实LLM服务负载研究揭示了用户与模型交互的动态演化规律,涵盖多模型、多用户场景,并将公开完整数据集以推动后续系统优化研究。」

近日,一篇题为《A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing》的研究论文在arXiv平台发布,为大语言模型(Large Language Model, LLM)服务系统的优化提供了前所未有的真实世界数据支持。该研究通过分析来自Chutes平台长达一年的生产级服务日志,深入刻画了LLM服务负载在时间维度、模型维度和用户维度上的演化特征。

当前,LLM已广泛应用于各类云服务场景,其推理服务成为关键计算负载之一。然而,此前关于LLM服务负载的研究普遍存在规模有限、观察周期短、数据采样不完整等问题,难以全面反映真实生产环境中用户行为与模型调用之间的复杂互动。相比之下,本研究首次提供了覆盖全年、横跨多个模型(包括热门模型与长尾模型)及大量用户的完整服务轨迹,极大丰富了对LLM服务生态的理解。

研究人员从聚合视角、时间序列、模型级别和用户级别四个维度对数据进行了系统性分析。结果表明,LLM服务负载并非静态分布,而是呈现出显著的时间演化特性——例如某些模型的使用频率会随季节或事件波动,而用户行为也展现出高度异质性,部分高频用户与大量低频用户共同构成了典型的“长尾”结构。这些细节在以往仅依赖聚合指标的研究中往往被掩盖。

尤为值得注意的是,该研究团队承诺将随论文一同公开完整的年度服务轨迹数据集。这一举措有望为学术界和工业界提供宝贵的基准资源,使后续研究无需依赖合成或抽样数据即可开展针对缓存策略、负载均衡、弹性调度等关键问题的实证分析。这对于构建高效、稳定、可扩展的LLM服务基础设施具有重要意义。

随着LLM推理成本持续成为行业关注焦点,理解真实负载模式已成为优化系统设计的前提。此项工作不仅填补了现有研究在数据广度与深度上的空白,也为未来面向LLM的服务架构创新奠定了坚实基础。研究团队强调,开放真实生产数据是推动AI系统研究走向实用化的重要一步,期待社区能在此基础上开发出更智能的调度算法与资源管理策略。

# 大语言模型 # 服务系统 # 负载分析 # 开源数据 # AI基础设施

来源:Heooo AI工具导航