# 蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环

- 来源：公众号：蚂蚁百灵（Ling）
- 作者：百灵大模型
- 发布时间：2026-08-14 12:00
- AIHOT 分数：62
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmssf79uf05rwrod09r9ocb2w
- 原文链接：https://mp.weixin.qq.com/s?__biz=MzkyODk2MDQwNw%3D%3D&mid=2247487525&idx=1&sn=b9def9117e34b45fce50ab76eeed726c

## 精选理由

真正可复用的不是井字棋，而是把可复现错误、可验证反馈、本地训练和同环境复测串成的轻量后训练闭环，适合为本地小模型稳定工具调用和格式约束。

## AI 摘要

蚂蚁百灵与 ASystem 团队合作，用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务，用 GSPO 算法训练 400 步后，rollout/rewards_mean 从约 -0.5 升至 0.4，response_len 降至约 850 tokens，工具调用与动作选择趋于稳定。

## 正文

公众号正文需在微信内阅读，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
