Astera Labs推出Leo X智能内存控制器,卸载KV Cache
「Astera Labs发布Leo X、Leo 2 E、Leo 2 P三系列智能内存控制器。其中Leo X基于网络架构设计,与Scorpio交换芯片配套,通过PCIe为GPU提供专用内存层以卸载KV Cache和智能体上下文,可将首词元延迟缩短最多62%、词元吞吐量提升最多22%。」
芯片高速互连企业 Astera Labs 宣布以 Leo X、Leo 2 E、Leo 2 P 三个系列丰富其 Leo 智能内存控制器产品线,进一步扩展其在 AI 基础设施互连与内存扩展领域的产品布局。此次发布的三款产品定位各异,分别面向标准内存扩展与 AI 加速器专属内存层两类场景。
其中,Leo 2 E 与 Leo 2 P 是符合标准 CXL 3.2 规范的芯片,均支持 4 个下游 DDR4 与 DDR5 内存控制器。两者的差异体现在上游端口配置上:Leo 2 E 支持 PCIe Gen6 1×16 单端口配置,而 Leo 2 P 在此基础上允许 2×8 双端口配置,从而实现附加内存的池化和共享。这一设计让同一份内存资源可以被多个计算单元按需访问,有助于提升内存利用率并降低整体部署成本。
更受关注的是 Leo X 系列。它是一款基于网络架构的智能内存控制器,专门为直接满足 AI 加速器侧的内存需求而设计。该系列芯片可与 Astera Labs 自家的 Scorpio 网络交换芯片配套使用,通过 PCIe 和平台专用协议实现 GPU 的横向扩展,为加速器提供一层专用的内存层,用于卸载 KV Cache 和智能体上下文。
在大模型推理场景中,KV Cache 会随着上下文长度增长而迅速膨胀,并持续占用加速器的高带宽内存资源,成为限制并发请求数与上下文窗口的重要瓶颈。将这部分数据卸载到外部专用内存层,可以让加速器本地内存更专注于模型权重与计算所需的数据,从而缓解容量压力。
Astera Labs 表示,Leo X 系列为 GPU 访问 KV Cache 提供了更低延迟、更高带宽的通道,能够将首词元延迟缩短多达 62%,并将词元吞吐量提升多达 22%。对于推理服务而言,这两项指标的改善直接关系到用户侧的首字响应体验与单位时间内的服务能力。
从产品组合来看,Leo 2 E、Leo 2 P 侧重标准化 CXL 内存扩展与池化,Leo X 则更贴合 AI 加速器对 KV Cache 与智能体上下文卸载的特定诉求,两者共同构成了 Astera Labs 在智能内存控制器方向上的完整拼图,也反映出随着推理负载规模扩大,内存层级重构正成为 AI 硬件生态的重要技术方向。
来源:Heooo AI工具导航