技术进展

手机端AI跑分新基准聚焦iPhone 17 Pro

Heooo 08月26日17时34分 14 阅读

「Artificial Analysis与Liquid AI合作推出面向手机端的AI跑分基准,重点测试苹果iPhone 17 Pro上体积不超过8GB的本地模型。测试涵盖函数调用、指令遵循等五项基准,结果显示Nanbeige4.2-3B和LFM2.5-2.6B在平均得分领先,LFM2.5-8B-A1B在响应速度上排名第一。」

人工智能评测机构Artificial Analysis近日宣布携手Liquid AI,共同推出了一套面向手机端的AI性能跑分基准。这一基准的发布,标志着移动端本地大模型的能力评估进入了一个更加系统化和专业化的阶段。该基准特别关注苹果iPhone 17 Pro上运行的本地AI模型,旨在为开发者及用户提供量化的性能参考。

该基准测试体系由双方分工合作完成。其中,Artificial Analysis负责智能水平测试系统的设计,而Liquid AI则主导推理性能测试系统。双方共选用了五项权威基准测试,涵盖不同维度的能力评估:BFCL(伯克利函数调用排行榜)用于检验模型调用外部工具和函数的能力,IFBench(指令遵循测试)衡量模型对复杂指令的理解和执行精度,AA-Omniscience则聚焦知识与认知相关任务,GPQA Diamond面向高难度问答场景,MATH-500用于评测数学问题求解能力。这五项测试共同构成了一个多维度的评估框架,能够较为全面地反映模型在真实移动应用场景中的综合表现。

本次测试的对象并非所有模型,而是经过4比特量化后体积不超过8GB的模型。这一约束条件与当前旗舰手机的内存配置以及本地推理的实用需求密切相关。示例模型包括Gemma 4 E2B和LFM2-2.6B-Exp等。在具体测试条件上,评测方设定了16K tokens的上下文长度限制,以及最长1分钟的响应时间限制,以模拟实际使用中的资源约束。

从测试结果来看,在平均基准测试得分方面,Nanbeige4.2-3B和LFM2.5-2.6B表现最为突出,并列第一。而在响应时间限制为一分钟的场景下,LFM2.5-8B-A1B排名第一,随后依次是LFM2-2.6B-Exp、Gemma 4 E4B(非推理版本)以及Granite 4.1 8B。这些排名结果直观地反映了不同架构和参数量模型在移动端的性能取舍。

值得注意的是,取得平均得分领先的Nanbeige4.2-3B模型,来自BOSS直聘旗下的南北阁实验室。该模型仅含30亿非嵌入参数(总参数约40亿),但其采用了独特的Looped Transformer架构。这一架构的核心创新在于,在不增加参数量的前提下复用Transformer层,通过循环两遍的方式提高模型的有效计算深度和容量。这种设计思路为在有限资源下提升模型能力提供了新的技术路径,也解释了其为何能够在较小体积下获得优异的评测成绩。

此次手机端AI跑分基准的发布,为业界提供了一个更加贴近移动场景的评估工具。它不仅有助于模型开发者了解自身模型的优劣势,也为手机厂商和用户在比较不同设备上的AI能力时提供了重要参考。随着端侧AI应用的普及,这类面向手机端的评测体系将持续推动移动AI技术的优化与进步。

# AI跑分 # 手机端模型 # 基准测试

来源:Heooo AI工具导航