Google EnvHarness 与 EnvRigger 构建智能体训练环境

elvis · @omarsar0 · X·2026-08-21 21:47·3天前
AI 导读

Google 提出 EnvHarness 与 EnvRigger,解决智能体训练环境静态化、无法随智能体进化的问题。EnvHarness 通过可编程插件层重塑环境行为且保留原验证器,EnvRigger 将策略视为黑盒、诊断其轨迹缺陷并合成新组件。在四个领域五个基准上,held-out 实例最高提升 9.0 分,执行步骤减少 9.8%。

elvis@omarsar0
30AI 编辑部评分,满分 100

Google EnvHarness 与 EnvRigger 构建智能体训练环境

2026-08-21 21:47· 3天前
AI 导读

Google 提出 EnvHarness 与 EnvRigger,解决智能体训练环境静态化、无法随智能体进化的问题。EnvHarness 通过可编程插件层重塑环境行为且保留原验证器,EnvRigger 将策略视为黑盒、诊断其轨迹缺陷并合成新组件。在四个领域五个基准上,held-out 实例最高提升 9.0 分,执行步骤减少 9.8%。

Impressive research from Google on building better environments for agents.

Training environments for agents are hand-built and go stale. The agent improves, the environment does not, and it's not able to see the agent's weaknesses in the first place.

EnvHarness wraps a static environment in a programmable plug-in layer that reshapes its behavior without touching the underlying logic. Every reshaped environment keeps its original verifier; this is what makes the reshaping safe to train on.

EnvRigger treats the policy as a black box, reads its execution trajectories, synthesizes harness components aimed at the diagnosed flaws, then validates them with fresh rollouts.

Across five benchmarks in four domains, up to 9.0 points better on held-out instances with 9.8% fewer execution steps.

Paper: https://arxiv.org/abs/2608.19880

Track more trending AI papers in our academy: https://academy.dair.ai/