Kog通过软件优化大幅提升GPU推理性能 封面图
技术进展

Kog通过软件优化大幅提升GPU推理性能

Heooo 08月14日23时00分 29 阅读

「法国初创公司Kog推出Kog Inference Engine(KIE),通过深度软件优化在标准数据中心GPU上实现高达3000 TPS的单请求推理速度,目标是让现有硬件高效运行大语言模型,解决当前AI推理成本与延迟瓶颈。」

在人工智能推理加速的激烈竞争中,专用芯片厂商如Cerebras凭借定制化硬件赢得了市场关注,但法国初创公司Kog却选择了一条不同的路径:通过软件优化,充分挖掘现有GPU的潜力。Kog认为,企业已经部署的数据中心GPU——如AMD MI300X和NVIDIA H200——仍有大量未被利用的计算能力,只需通过更深层次的软件调度即可释放。

Kog通过软件优化大幅提升GPU推理性能

今年5月,Kog在Hacker News首页引发热议,其技术预览展示了在标准GPU上实现“极快单请求解码”的可能性。演示中,Kog使用自研的小型模型Laneformer 2B(约20亿参数)达到了每秒3000个token的推理速度(TPS)。尽管该模型规模较小,但这一成果已远超当前主流大语言模型在相同硬件上的表现。

Kog首席执行官Gaël Delalleau表示,公司已收到超过200个明确的商业合作意向。早期反馈显示,软件工程是最迫切的应用场景之一。许多开发者在使用Claude Code等工具时,常需等待数小时才能获得结果。Anthropic甚至为此推出了收费更高的“Fast Mode”,侧面印证了推理速度的商业价值。

Kog的目标客户正是那些因AI工作流延迟而效率受限的专业用户。此外,一些设计合作伙伴也在探索利用Kog的推理引擎加速生成式应用——例如通过自然语言提示快速构建游戏或应用程序。更快的响应意味着更高的用户留存与收入转化,Delalleau指出。

Kog通过软件优化大幅提升GPU推理性能

值得注意的是,Kog观察到市场尚未准备好大规模微调小型模型。因此,自发布以来,团队将全部精力转向支持更大规模语言模型的高效推理。尽管目前演示基于20亿参数模型,Delalleau坚信其技术可无缝扩展至百亿甚至千亿参数级别。他反驳了“GPU不适合解码任务”的流行观点,强调新一代GPU不断提升的内存带宽正为高吞吐推理提供基础。

Kog并非唯一尝试通过软件突破硬件限制的公司。同样来自法国的ZML开发了绕过CUDA的硬件无关推理框架。但Delalleau认为,Kog的方法更接近斯坦福大学Hazy Research实验室的思路——聚焦于GPU底层架构的极致优化,而非抽象层兼容。

作为非学术背景的连续创业者(其上一家公司Stribe曾入选TechCrunch50 2009),Delalleau带领Kog走出了一条务实的技术路线:不依赖新硬件,而是让企业现有的AI基础设施发挥更大价值。在推理成本日益成为AI落地关键瓶颈的当下,Kog的软件优先策略或许能为行业提供一条更具性价比的加速路径。

# GPU推理优化 # 大语言模型 # Kog Inference Engine # AI加速 # 开源模型

来源:Heooo AI工具导航