AI-NEWS · 2026年 8月 15日

百灵模型跑通本地 RL 闭环

告别“本地模型”的幻觉:百灵大模型联手开源社区构建单端智能体强化学习闭环

蚂蚁集团 ASystem 团队联合开源社区,基于百灵(BaiLing)大模型和开源后训练工具 AReno,在单台机器上跑通了智能体强化学习闭环。这套方案验证了本地模型无需云端大规模算力支撑,也能通过闭环迭代进化出处理复杂规则、严守安全边界及调用外部工具的能力。

实验选用了规则清晰的井字棋作为最小验证任务,硬件环境是 DGX Spark,基础模型是 Ling-3.0-tiny,总参数量 79 亿,激活参数量 13 亿。训练算法采用 GSPO,设置了 400 轮训练步数。

跑完这 400 步后,模型发生了质变。训练前它懂基本规则但会犯非法动作,训练后不仅平均奖励显著增加,输出长度也趋于收敛,不再随意发散。最关键的突破在于工具调用和动作选择上,模型从“会犯错”变成了“稳定且理性地调用工具”。

这套模式的核心价值在于提供了一套透明且可复现的任务适配方法:先精准定位模型错误,再建立可验证的反馈机制,最后在同一本地环境里完成训练和复测。

目前百灵的 Ling-3.0-tiny 模型已提供 BF16、FP8、INT4 等量化版本,开发者可以在 Hugging Face 或魔搭社区获取。AReno 开源仓库对后续的代码开发和技术讨论也是开放的。

除了棋类游戏实验,这套流程能平滑迁移到真实生产场景,具体包括工具调用修复、结构化字段提取、领域指令遵循以及业务流程中的智能体开发。

火龙果频道