技术进展
英伟达让KV缓存可跨模型迁移
Heooo 08月11日13时02分 31 阅读
「英伟达研究团队实现KV缓存跨模型迁移,目标模型可跳过预填充阶段,转换速度比重新处理上下文快2.7至25倍。该技术避免切换或升级模型时的重复计算,降低长文本推理成本,有望改变AI推理基础设施设计,让模型切换更流畅经济。」
英伟达的研究团队近日取得一项重要突破,他们找到了让KV缓存在不同模型之间迁移的方法。借助这一技术,目标模型可以直接跳过预填充阶段,转换速度比重新处理上下文快2.7到25倍。
要理解这个突破的意义,需要先了解KV缓存的作用。在使用ChatGPT或Claude时,你会发现第一个词的生成总是明显更慢,然后后面的内容几乎是瞬间涌出。这背后是一个刻意设计的机制——模型在生成第一个词之前,需要处理整个输入上下文,把中间结果存储为KV缓存。之后的每个词都可以复用这些缓存,所以速度快得多。
问题在于,KV缓存一直是“一次一模型”的。如果你切换到另一个模型,或者升级了模型版本,之前计算好的缓存就全废了,新模型必须从头开始处理整个上下文。对于长文本场景,这意味着大量的重复计算和时间浪费。
英伟达的方案让KV缓存变得可迁移。一个模型计算出的缓存,经过转换后可以被另一个模型直接使用,目标模型完全跳过预填充阶段。转换过程本身也比重新处理上下文快得多——速度提升在2.7倍到25倍之间,具体取决于模型和上下文的复杂度。
这对AI行业的影响是深远的。当前LLM API的使用成本中有相当一部分来自上下文处理,尤其是长对话和长文档场景。如果KV缓存可以在模型之间迁移,意味着用户在切换模型时不必承担重复计算的成本,模型升级时也不必丢弃已有的对话上下文。这项研究可能会改变AI推理基础设施的设计方式,让模型之间的切换变得更加流畅和经济。
# KV缓存 # 模型迁移 # 推理加速 # 英伟达
来源:Heooo AI工具导航