Google DeepMind 正在把 EVE Online 变成 AI 的长期试验场。
乍看是游戏新闻,实际它瞄准的是 Agent 下一阶段最难的四件事:
- 持续学习,新知识进来以后不忘掉旧能力
- 长期记忆,跨越远超模型上下文窗口的时间尺度
- 长周期规划,按周、月甚至年来做决策
- 多智能体协作,在合作、竞争、谈判和经济系统中行动
过去的 AI benchmark 大多有固定规则、明确目标和最终得分。但真实世界没有标准答案,环境一直在变化,其他参与者也会根据你的行动不断调整。
EVE Online 恰好是一个运行了 20 多年的持久世界:玩家创造经济、联盟、冲突和外交,今天的决定可能几个月以后才看到结果。
这比让模型一次性答对一道题,更接近企业真正需要的 Agent。
企业里的 Agent 也要记住过去发生了什么,理解组织关系,适应规则变化,与人和其他 Agent 协作,并为自己的长期结果负责。
所以未来真正有价值的 Agent,不是每次被叫醒后完成一个任务,而是能在一个持续变化的系统里不断学习、积累记忆,并长期演化。
也许 AGI 最终的 benchmark 不是一张更难的试卷,而是一个真实运转的社会。