Dongxi 东锡 NLP · @dongxi_nlp · X·2026-08-21 01:50·14天前
AI 导读

SPADE: 自适应合成可执行环境中的自对弈 [引用 @_AndrewZhao]:我们提出 SPADE,面向通用智能体的自对弈方法,其中环境和任务均由智能体自身生成并持续改进。我们使用带/不带提示的遗憾值来训练环境生成器。随着我们迈向 RSI,决定学习什么将成为最重要的问题。

Dongxi 东锡 NLP@dongxi_nlp
25AI 编辑部评分,满分 100
2026-08-21 01:50· 14天前
AI 导读

SPADE: 自适应合成可执行环境中的自对弈 [引用 @_AndrewZhao]:我们提出 SPADE,面向通用智能体的自对弈方法,其中环境和任务均由智能体自身生成并持续改进。我们使用带/不带提示的遗憾值来训练环境生成器。随着我们迈向 RSI,决定学习什么将成为最重要的问题。

SPADE:

Self-Play in Adaptive Synthetic Executable Environments

Andrew ZhaoWe introduce SPADE, selfplay for general agents, where the env and the task are both generated and continuously improved by agent themselves. We use regret with...

来源:Dongxi 东锡 NLP· x.com