AI-NEWS · 2026年 8月 27日

小模型打破智能天花板

8 月 24 日,AI 评估组织 Artificial Analysis 联合 Liquid AI 发布了移动端 AI 基准测试。测试对象是即将上市的 iPhone 17 Pro 本地运行环境,合作分工很明确:Artificial Analysis 负责测智能水平,Liquid AI 负责测推理性能。测试维度覆盖五大类基准测试,包括函数调用、指令遵循、知识理解、难题解答及数学计算。

本次基准测试聚焦于可在移动端边缘设备上运行的模型,核心标准是模型大小不超过 8GB(4-bit 量化后)。在设置 16K Token 上下文限制时,表现最佳的模型是 Nanbeige4.2-3B(源自南华实验室),其次是 LFM2.5-2.6B(源自 Liquid AI)。当将响应时间严格限制在 1 分钟内时,排名发生显著变化,榜首是 LFM2.5-8B-A1B,紧随其后的是 LFM2-2.6B-Exp、Gemma 4 E4B 和 Granite 4.1 8B。

测试结果揭示了一个重要的行业趋势:小参数模型同样能展现出极高的智能水平,甚至在特定场景下超越大模型。以 Nanbeige4.2-3B 为例,该模型由 BOSS 智屏实验室开发,参数量仅 30 亿非嵌入参数,采用 Looped Transformer 架构。通过循环复用模型层,该架构在不增加参数量的前提下有效增加了计算深度,实现了与竞争对手相当甚至更优的评分。

移动端 AI 的竞争逻辑正在发生根本性转变。过去竞争重点在于“能否运行”,即能否在设备本地部署;现在竞争焦点已升级为“运行得更快”且“回答得更准确”。架构创新正在弥补小模型参数量的劣势,使得轻量级模型在移动端具备与大型云端模型相抗衡的潜力。这对手机厂商和芯片厂商的算力调度提出了新的要求,他们得重新规划资源分配策略。

火龙果频道