开源推理引擎Magnitude发布,开源模型最高提速两倍
「开源推理引擎Magnitude正式发布,专为AI Agent打造,可在用户设备上编译并调优内核,性能最高达llama.cpp的两倍,其中Metal解码提速92%,CUDA提速19%。引擎兼容Apple Silicon、NVIDIA、AMD及纯CPU,内存占用降低27%,支持一键连接主流Agent,采用Apache 2.0许可。」
近日,开源推理引擎Magnitude在Hacker News上发布,这是一款专为AI Agent设计的自优化推理引擎,主打让开源模型以硬件允许的最快速度运行。与传统推理引擎预先为广泛硬件类别编译内核不同,Magnitude会在模型运行之前,在用户的实际设备上编译并调优内核,使其精确适配具体的芯片,从而带来更优的性能表现。
根据官方公布的数据,Magnitude相比llama.cpp最高可提速两倍,其中在Metal后端上解码速度提升92%,在CUDA后端上提升19%。这种提升主要来自针对设备的即时调优:引擎会为当前硬件手工优化内核,并且针对最流行的开源权重模型家族提供专门优化过的内核,这也是它能够超越通用推理引擎的关键原因。
在内存管理方面,Magnitude为每个Agent减少了约27%的内存占用,并且当Agent停止运行时会及时释放内存。对于需要同时运行多个会话的场景,引擎让各个会话共享前缀缓存,从而避免并发请求带来的性能下降。
硬件兼容性上,Magnitude支持任意Apple Silicon、NVIDIA或AMD GPU,甚至在没有独立加速硬件、仅有CPU的机器上也能运行。官方表示不存在固定的最低配置门槛:配置较小的机器可以运行较小的模型,内存越充裕则可以运行参数规模更大的模型。目前该引擎提供macOS、Windows与Linux三个平台的桌面应用,并内置了Magnitude命令行工具,用户无需单独安装CLI。
在生态接入方面,Magnitude强调与用户已有的Agent工具无缝衔接。用户只需一键即可连接Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi以及Cline等Agent,其他工具则可以通过OpenAI兼容的API接入。快速上手流程也相当简单:下载并安装应用,在Discover中选择推荐的模型并下载,然后在Connections中连接自己的Agent即可开始使用。
Magnitude采用Apache 2.0许可开源,完全免费,不产生token费用。官方特别强调隐私属性:提示词、文件与模型都保留在用户本地机器上,模型下载完成后即使不联网也能正常使用。对于关注数据隐私、又希望在本地获得更快推理速度的开发者而言,这款自优化推理引擎提供了一个值得关注的新选择。
来源:Heooo AI工具导航