端侧AI跑分基准发布 小模型性能座次排定
「AI评测机构Artificial Analysis携手Liquid AI推出面向手机端的本地AI性能基准,在iPhone 17 Pro上对8GB内模型进行智能与推理双重测试。结果显示,Nanbeige4.2-3B与LFM2.5-2.6B在平均得分领先,而LFM2.5-8B-A1B在响应时间限制下登顶,端侧小模型智能竞赛从能跑转向跑得快、答得准。」
手机本地AI的竞争正在进入新的阶段。AI评测机构Artificial Analysis于近日发布博文,宣布携手Liquid AI推出全新的手机端本地AI性能基准,重点考察模型在苹果iPhone 17 Pro上的真实表现。这一基准的发布,为衡量端侧小模型的智能水平与推理效率提供了可量化的标尺。
双方分工明确:Artificial Analysis负责智能水平测试,聚焦模型的认知与回答能力;Liquid AI则负责推理性能测试,关注执行效率与响应速度。测试共选用函数调用、指令遵循、知识认知、高难问答与数学五类基准,覆盖了端侧AI应用的典型场景。所有测试对象均为4 bit量化后体积不超过8GB、可在移动设备上直接运行的模型,示例包括Gemma 4 E2B与LFM2-2.6B-Exp等。
在上下文限制16K tokens的场景下,平均得分最高的模型来自南北阁实验室的Nanbeige4.2-3B与Liquid AI的LFM2.5-2.6B。值得注意的是,Nanbeige4.2-3B仅拥有30亿非嵌入参数,却凭借Looped Transformer架构实现了对层参数的循环复用,在不增加参数规模的前提下有效提升了计算深度,从而在多项测试中比肩体积更大的模型。这一架构创新展示了小模型通过结构优化获得高智能的可能性。
若将响应时间限制在1分钟内,LFM2.5-8B-A1B则登顶排行榜,其后依次为LFM2-2.6B-Exp、Gemma 4 E4B与Granite 4.1 8B。这一结果说明,在端侧场景中,模型不仅要“聪明”,还要“快速”。用户对本地AI的体验往往取决于首字响应时间与推理吞吐量,单纯追求参数量或离线评测得分已不足以反映真实使用感受。
此次基准的发布,把端侧小模型的智能上限摆上了台面。手机本地AI的竞赛正从“单纯能跑”转向“跑得快、答得准”。未来,随着量化技术、架构设计与硬件适配的进一步成熟,更小体积、更高智能、更低延迟的模型将成为移动AI应用的核心竞争力。开发者可以依据这套基准,在智能手机上更科学地选择与优化本地模型,从而提升用户的实际体验。
来源:Heooo AI工具导航