返回资讯列表横轴表示“输出 256 个 token 所需的时间(秒)”,纵轴表示“上下文长度限制为 16K 个 token 时的平均基准测试得分”。“Nanbeige4.2-3B”的基准测试得分与“LFM2.5-2.6B”相当。 在上下文长度限制为 16K 个 Token 时,平均基准测试得分中得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.6B。 当响应时间限制为最长 1 分钟时,LFM2.5-8B-A1B 排名第 1,随后是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。
ithome
•2026-08-26 15:12Artificial Analysis 公布苹果 iPhone 17 Pro 跑 8GB 以内本地 AI 性能排名
IT之家 8 月 26 日消息,Artificial Analysis 于 8 月 24 日发布博文,宣布携手 Liquid AI,发布面向手机端的 AI 跑分基准,重点关注 AI 模型在苹果 iPhone 17 Pro 上的表现。
其中 Artificial Analysis 负责智能水平测试系统,Liquid AI 负责推理性能测试系统,双方选用 5 项基准测试:
BFCL(Berkeley 函数调用排行榜)
IFBench(指令遵循测试)
AA-Omniscience(知识与认知相关测试)
GPQA Diamond(高难度问答测试)
MATH-500(数学问题测试)。
测试模型对象为 4 bit 量化后体积不超过 8GB 的模型,示例包括 Gemma 4 E2B 和 LFM2-2.6B-Exp。
当上下文长度限制为 16K tokens 后,平均基准测试得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.6B。当响应时间限制为最长 1 分钟时,LFM2.5-8B-A1B 排名第 1,随后是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。
Nanbeige4.2-3B 是 BOSS 直聘旗下的南北阁实验室推出,仅含 30 亿非嵌入参数(总参数约 40 亿),采用 Looped Transformer 架构,通过在不增加参数量的前提下复用 Transformer 层(循环两遍),提高模型的有效计算深度和容量。
IT之家附上相关截图如下:
最新资讯
Anthropic 详解 7·30 安全事件:配置错误致 Claude“入侵”真实企业,已加强沙箱隔离与实时监控
ithome•2026-09-01 07:55
Mac 成 AI 硬件宠儿:苹果提前发布 2026 款 mini / Studio,全球需求激增促成 8 月上新
ithome•2026-09-01 07:49
IT早报 0901:华为、小米、荣耀手机今日集体调价;库克担任苹果 CEO 最后一天给员工发告别信;曝网易全系产品将登陆华为鸿蒙系统;国内首部 AIGC 长剧《后西游记》开播...
ithome•2026-09-01 07:44
微信鸿蒙版 App 获 8.0.21.34 版本邀测升级,修复了一些已知问题
ithome•2026-09-01 07:24
苹果 MacBook Neo 8GB 被曝 SSD 寿命隐患:3 小时写入近 900GB,高强度下寿命不足两月
ithome•2026-09-01 07:15