CPU回归:LLM推理的算力分工再思考
「随着AI推理从单一问答转向多步推理与代理编排,CPU与GPU的算力分配正在重新平衡。英特尔指出推理负载中CPU与GPU比例将从训练时的1:8变为1:1甚至4:1。本文基于Red Hat分析,探讨CPU在指令延迟、编排控制与工具调用方面的独特优势,以及为何传统GPU主导的推理范式正被重新审视。」
过去三年,GPU几乎成为大语言模型推理的代名词。在传统聊天机器人场景中,GPU负责绝大部分计算,CPU只提供每请求的一小部分算力。然而,推理并非只是单个模型回答单个问题。随着工具调用、多步推理以及跨多个专用模型进行编排的需求增长,计算应该放在哪一侧的等式正在发生根本性变化。
英特尔已经明确指出了这一趋势:CPU与GPU的比例正在从训练负载中的1:8,转向推理与代理部署中的1:1,某些情况下甚至达到4:1。这一数据背后,反映的是推理工作负载本身的结构性变化——它不再是一段密集矩阵乘法的流水线,而是混合了逻辑判断、数据解析、外部接口调用和复杂控制流的综合任务。
CPU与GPU的本质差异
CPU和GPU解决的是两种截然不同的问题。现代GPU拥有数万个核心,设计目标是在数千个数据元素上同时执行相同操作。这使得GPU在Transformer前向传播所主导的稠密矩阵乘法中极为高效。在高并发批次推理或训练阶段,这种并行能力直接转化为吞吐量:每秒更多的token数,以及每美元算力能服务更多请求。
相比之下,现代CPU通常拥有从单核到数百核不等的核心,这些核心针对顺序、条件分支和逻辑跳转进行了优化。CPU特别擅长在复杂决策树中快速执行单一操作,能够直接访问主系统内存,也是包裹任何模型的编排层的自然运行环境。工具分发、代码执行、Python运行时、沙箱、输入输出,乃至代理循环的控制流,全都驻留在CPU上。
两种架构性质不同,但并非彼此竞争,而是最适合协同工作。真正的问题不是哪个架构更优秀,而是哪类工作负载应该放到哪一侧。
FLOPS与指令延迟:算力的度量差异
这种分工最终归结为两种不同的度量标准:FLOPS和指令延迟。GPU以每秒浮点运算次数为生命线。由于AI模型本质上是大量十进制数的乘加网络,GPU的任务就是同时暴力运算数以万亿计的矩阵计算,它完全为原始数学吞吐量而生。
CPU则专注于指令延迟,即单个核心执行一串不可预测的多样化指令的速度。一个CPU核心擅长快速进行逻辑切换,以解析JSON、处理网络I/O或检查安全权限。如果强行让GPU运行混乱的Python运行时,其庞大的FLOP能力会因频繁任务切换而闲置;反之,如果让CPU去处理LLM的海量数学运算,则会陷入计算效率的泥潭。
这种度量差异决定了各自的最佳领域。训练和超高并发批处理推理是GPU的绝对主场;而代理型工作负载、多模型编排、流式控制、工具调用等,则是CPU的天然领地。
推理形态的转变正在重塑需求
行业正在从单一模型、单次问答的简单范式,走向多步骤推理和跨模型编排的复杂范式。一个智能体可能需要调用多个小型专用模型,每个模型只负责一个子任务,同时需要解析结果、决定下一步动作、再触发新的调用。这种控制密集型负载会显著增加CPU的参与度。
Red Hat的分析指出,CPU与GPU的关系并非互相替代,而是各自承担最合适的工作。GPU负责高密度的矩阵运算,CPU负责运行编排层、处理工具调用和执行控制流。两者配合,才能让整个推理系统达到最优的吞吐和延迟平衡。
随着推理场景从纯对话走向更广泛的代理应用,CPU在算力图谱中的地位正在回升。未来的AI基础设施,或许不再是GPU一面倒,而是CPU与GPU按照工作负载特征进行更精细的重新分配。
来源:Heooo AI工具导航