万博manbext体育官网Liquid AI 郑重推感性能测试系统-万博manbext体育官网(中国)官方网站登录入口

发布日期:2026-08-28 06:04    点击次数:194

IT之家 8 月 26 日音尘,Artificial Analysis 于 8 月 24 日发布博文,晓示联袂 Liquid AI,发布面向手机端的 AI 跑分基准,要点关爱 AI 模子在苹果 iPhone 17 Pro 上的进展。

其中 Artificial Analysis 郑重智能水平测试系统,Liquid AI 郑重推感性能测试系统,两边采用 5 项基准测试:

BFCL(Berkeley 函数调用排名榜)IFBench(教导革职测试)AA-Omniscience(学问与融会关系测试)GPQA Diamond(高难度问答测试)MATH-500(数学问题测试)。

测试模子对象为 4 bit 量化后体积不进步 8GB 的模子,示例包括 Gemma 4 E2B 和 LFM2-2.6B-Exp。

当高下文长度截至为 16K tokens 后,平均基准测试得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.6B。当反适时分截至为最长 1 分钟时,LFM2.5-8B-A1B 排名第 1,随后是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。

Nanbeige4.2-3B 是 BOSS 直聘旗下的南北阁推行室推出,仅含 30 亿非镶嵌参数(总参数约 40 亿),弃取 Looped Transformer 架构,通过在不加多参数目的前提下复用 Transformer 层(轮回两遍),升迁模子的有用策画深度和容量。

横轴示意“输出 256 个 token 所需的时分(秒)”,纵轴示意“高下文长度截至为 16K 个 token 时的平均基准测试得分”。“Nanbeige4.2-3B”的基准测试得分与“LFM2.5-2.6B”颠倒。

在高下文长度截至为 16K 个 Token 时,平均基准测试得分中得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.6B。

当反适时分截至为最长 1 分钟时,LFM2.5-8B-A1B 排名第 1,随后是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。

IT之家附上关系截图如下:

万博manbext体育官网