公众号:蚂蚁百灵(Ling)
精选
62AI 编辑部评分,满分 100

蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环

2026-08-14 12:00· 10分钟前· 百灵大模型
AI 导读

蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。

推荐理由

真正可复用的不是井字棋,而是把可复现错误、可验证反馈、本地训练和同环境复测串成的轻量后训练闭环,适合为本地小模型稳定工具调用和格式约束。

公众号正文需在微信内阅读,站内仅提供摘要。

在微信中打开原文

来源:公众号:蚂蚁百灵(Ling) · mp.weixin.qq.com

返回
精选AI 评分 62/100

蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环

公众号:蚂蚁百灵(Ling)·2026-08-14 12:00·10分钟前·百灵大模型
AI 导读

蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。

公众号正文需在微信内阅读,站内仅提供摘要。

在微信中打开原文(在新标签页打开)

来源:公众号:蚂蚁百灵(Ling)· mp.weixin.qq.com