技术进展

PrismML 发布 Bonsai 2 27B 三值量化模型

Heooo 09月18日19时02分 40 阅读

「人工智能实验室 PrismML 推出三值量化模型 Bonsai 2 27B,基础模型升级至 Qwen3.8 27B,每个权重有效比特仅 1.76,模型体积 5.9GB,支持 262K 上下文,以不到九分之一的内存占用取得基础模型 98.2% 的综合成绩,并以 Apache 2.0 许可证开放权重。」

人工智能实验室 PrismML 宣布推出全新三值量化模型 Bonsai 2 27B。这是继今年早些时候发布的 Bonsai 27B 之后,该团队在同一技术路线上的又一次迭代。上一代 Bonsai 27B 基于 Qwen3.6 27B 微调,以显著更低的内存占用实现了基础模型 95% 的性能;而 Bonsai 2 27B 把基础模型升级到了 Qwen3.8 27B,并在推理、编程、视觉以及长程智能体等维度实现全面提升。

最引人关注的是量化效率。Bonsai 2 27B 采用三值量化方案,配合 FP16 分组缩放,每个权重的有效比特数仅为 1.76,模型总体积压缩到 5.9GB,却支持高达 262K 的上下文窗口。在综合基准测试中,它以不到基础模型九分之一的内存占用,取得了 Qwen3.8 27B 基础模型 98.2% 的分数,整体表现甚至优于上一代 Qwen3.6 27B 基础模型。这意味着在权重被极度压缩的前提下,模型能力几乎没有出现明显折损,量化损失被控制在很小的范围内。

性能数据方面,Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上可实现 143TPS 的词元吞吐量,在 Apple Silicon M5 Max 上可达 46.8TPS。能效表现同样出色,在 GeForce RTX 4090 上每词元能耗为 0.714mWh,比全精度 8B 模型低 40%。对于需要在本地持续运行推理任务的开发者来说,更低的能耗往往直接决定了设备能否长时间承载智能体循环。

部署方面,该模型可通过 CUDA 在 NVIDIA GPU 上运行,也可通过 MLX 在 Apple 设备上运行,覆盖了消费级显卡与 Mac 两条主流的本地推理路径,并以 Apache 2.0 许可证开放权重,允许开发者自由使用与二次开发。

PrismML 表示,Bonsai 2 27B 足以在本地承担编程智能体循环、计算机使用工作流、私有文档解析、多模态调试与混合编排等真正的知识工作,仅在需要时才调用云端 API。这一思路反映出端侧与本地部署路线的持续演进:在内存与能耗都受限的设备上,尽量保留接近全精度大模型的能力,把云端调用留给真正必要的场景,从而在成本、隐私与响应速度之间取得新的平衡。

# 三值量化 # 模型压缩 # 开源模型

来源:Heooo AI工具导航