ACTS:面向高效可控LLM推理的智能体链式思维引导

HuggingFace Daily Papers(社区热门论文)·2026-06-02 08:00·89天前
AI 导读

ACTS将推理引导建模为马尔可夫决策过程,控制器智能体在推理中自适应引导冻结的推理器。控制器每步观察推理轨迹与剩余预算,发出含推理策略和引导短语的动作,实现预算感知的推理控制。控制器通过合成轨迹初始化,并经强化学习优化。在多个基准上,ACTS以显著token节省匹配全思考性能,实现可控的精度-效率权衡。代码已开源。

HuggingFace Daily Papers(社区热门论文)
精选
70AI 编辑部评分,满分 100

ACTS:面向高效可控LLM推理的智能体链式思维引导

2026-06-02 08:00· 89天前
AI 导读

ACTS将推理引导建模为马尔可夫决策过程,控制器智能体在推理中自适应引导冻结的推理器。控制器每步观察推理轨迹与剩余预算,发出含推理策略和引导短语的动作,实现预算感知的推理控制。控制器通过合成轨迹初始化,并经强化学习优化。在多个基准上,ACTS以显著token节省匹配全思考性能,实现可控的精度-效率权衡。代码已开源。

推荐理由

ACTS 把 LLM 推理过程变成可控制的 MDP,用预算感知的策略节省 token 同时保持精度,做推理加速的研究者应该试试他们开源的代码。

正文 · AI 翻译

大语言模型通过扩展的链式推理能够提升最终答案的准确率,但往往在 token 使用上效率低下,且推理时几乎无法进行控制。现有的高效推理方法通过缩短、提前终止或压缩推理轨迹来控制思考长度,但模型的思考方式仍是隐式的。本文提出智能体链式推理引导(ACTS),将推理引导建模为一个马尔可夫决策过程,其中控制器智能体在推理过程中自适应地引导一个冻结的推理器。在每一步,控制器观察当前的推理轨迹和剩余思考预算,然后发出一个引导动作,该动作包含一个推理策略和一个引导短语,用于启动推理器的下一步。这使得在保持推理器生成连续性的同时,能够实现预算感知的策略控制,从而实现高效推理。我们利用构建的合成引导轨迹(含多预算增强)来初始化控制器智能体,并通过带预算条件奖励塑形的强化学习进一步优化。在多个基准测试上的实验表明,ACTS 在实现与完整思考相当的性能的同时,大幅节省了 token,并能在不同的推理器和任务间实现可控的准确率-效率权衡。代码已开源在 https://github.com/Andree-9/ACTS。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org