7 月 24 日蚂蚁集团上线了原生混合推理模型 Ling-3.0-Flash。总参数量 124B,激活参数仅 5.1B。模型在推理速度、指令遵循和长文本处理上的表现,对标参数量 2 至 3 倍的行业顶尖水平。目前 OpenRouter 已开放免费试用一周,随后正式开源。
Agent 应用对模型稳定性要求极高,Ling-3.0-Flash 通过三个具体改动解决了传统模型“跑偏”问题。训练数据从静态语料换成了超过 10,000 个真实交互环境,让模型在代码编写和复杂任务拆解时能自主闭环。配合优化的自我修正与长期规划机制,模型在长链条任务中的成功率明显提升。
架构层面,模型用计算效率的牺牲换取了长上下文能力的突破。混合注意力架构中,KDA 线性注意力层与 MLA 层按 5:1 比例交替,平衡了效率与能力。KDA 引入的对角门控机制,让模型在 Delta Rule 状态更新时能更精准地记忆关键信息,这对处理大文档和代码库非常有效。专家激活率从上一轮的 1/32 压降至 1/64,这意味着同等算力下能处理更多的并发请求。
工程侧的优化直接体现在用户感知上。集群层级分层缓存系统避免了长对话中的重复计算,首字响应延迟在长输入场景下降低了 60% 到 80%。多 Agent 协作架构让不同智能体间能互相校验,降低了单一模型犯错导致任务失败的风险。这套组合拳让模型在保持小体积的同时,具备了支撑高频在线服务的能力。
