高通携手PrismML推出1-bit Bonsai视觉模型
「高通与PrismML在骁龙AR1 Gen 1智能眼镜平台上本地运行了20亿参数的1-bit量化Bonsai视觉模型,AI眼镜离线即可识图问答。该模型内存占用约为4-bit模型的四分之一,同容量下可容纳约4倍参数,文本Token生成速度翻倍,并有助于延长续航、减少发热。」
在骁龙峰会上,高通与PrismML公司联合宣布,已在骁龙AR1 Gen 1智能眼镜平台上成功本地运行20亿参数的1-bit量化Bonsai视觉模型。这一成果让AI眼镜在完全离线的状态下也能完成识图与问答,不再依赖云端算力的往返调度。
Bonsai 1-bit模型基于PrismML此前发布的Bonsai 1.7B版本构建,核心思路是把模型精度压缩到1-bit,从而大幅降低存储与推理所需的内存资源。官方表示,这种压缩策略在相同内存容量下可容纳约4倍参数,内存占用约为传统4-bit模型的四分之一,文本Token生成速度则实现翻倍。
为什么低比特量化对智能眼镜格外关键?
智能眼镜的体积与散热空间都极为受限,内存容量和功耗预算远低于手机与PC。以往要完成视觉识别类任务,设备通常需要把图像或请求发往云端,等待网络往返后再把结果回传。这一链路不仅带来延迟,也让交互体验受制于网络质量。将模型真正放到本地运行,意味着响应路径被缩短到设备内部,交互的即时性由此得到改善。
在落地场景上,官方给出的能力包括识别眼前物体、翻译文字、回答环境相关问题,以及提供免手操作的语音帮助。在这些场景中,AI交互不再需要连接云端等待,可直接在本地完成,用户抬起眼镜即可获得反馈,无需掏出手机。
除速度之外,1-bit量化带来的另一重收益是能效。更小的内存占用与更低的推理开销,有助于减少发热并延长续航,从而改善整体佩戴体验。对于长时间佩戴的可穿戴设备而言,发热与续航往往比峰值算力更能决定产品是否可用,这也是端侧模型压缩技术受到关注的原因。
从技术路径看,把权重压缩到极低比特,本质上是在精度与资源之间重新寻找平衡点。视觉问答类任务对细节的容忍度相对较高,这为低比特方案留出了空间。高通与PrismML此次把20亿参数级别的模型放进眼镜形态的终端,说明端侧多模态推理的可行性边界正在被继续推开。随着模型压缩、量化与硬件协同设计持续演进,AI眼镜等可穿戴设备有望在离线状态下承载更多视觉与语音交互能力。
来源:Heooo AI工具导航