百灵团队打通本地智能体强化学习闭环 封面图
技术进展

百灵团队打通本地智能体强化学习闭环

Heooo 08月14日18时01分 27 阅读

「蚂蚁ASystem团队联合AReno开源工具包,与百灵大模型合作推出轻量级后训练方案,在单机环境成功打通Agentic RL闭环。以井字棋为验证任务,对Ling-3.0-tiny模型进行400步GSPO训练后,工具调用稳定性显著提升,相关模型已开源。」

模型能够完成本地部署,并不意味着它在真实业务场景中能够游刃有余。在具体的业务流程中,AI不仅需要具备基础的对话能力,还必须精准理解复杂的规则、遵守安全边界,并正确调用外部工具以输出符合规范的结果。为了攻克这一痛点,蚂蚁ASystem团队联合开源社区共同维护的本地化大模型后训练工具包AReno,近日携手百灵大模型推出了一条轻量级的后训练实践路径,成功在单机环境中打通了Agentic强化学习闭环。

为了确保整个技术方案具备高度的可复现性,本次合作选取了规则清晰、反馈直接的井字棋作为最小验证任务。实验基于DGX Spark硬件环境,对拥有7.9B总参数但激活参数仅为1.3B的Ling-3.0-tiny模型展开了后训练。在训练初期,模型虽然能够理解基本规则,但在交互过程中仍会出现非法动作;而通过将任务规则转化为精确的Reward反馈机制,并借助GSPO算法进行400个步骤的训练后,模型的奖励均值明显提升,输出长度也随之收敛。

百灵团队打通本地智能体强化学习闭环

复测结果充分证明,模型在工具调用与动作选择上的稳定性与合理性得到了质的飞跃。这一探索的核心价值在于验证了一条透明、可复现的任务适配方法论:从精准发现错误、定义可验证反馈,到完成本地训练并回到同一环境进行复测。该模式不仅适用于棋类实验,更可以流畅迁移至工具调用修复、结构化字段抽取、领域指令遵循以及业务流程智能体等多元化的真实生产场景中。

目前,Ling-3.0-tiny已提供BF16、FP8和INT4等多种开源版本,开发者可通过Hugging Face或魔搭社区获取并使用,同时也可以访问AReno开源仓库参与后续的代码共建与技术讨论。这条低门槛的后训练路径,为本地化智能体的落地提供了一套可验证、可复用的工程范式。

# 强化学习 # 后训练 # 开源工具

来源:Heooo AI工具导航