为什么现在大家都在讨论长程任务? 难道让 AI 不断"加班", 就一定能得到更好的结果吗?
Nope!
我平时会拆解很多 AI 评测框架, 给大家不断丰富测试内容, 让大家更全面地理解现在 AI 的真实能力. 今天我刚测过的这个框架就很适合回答这个问题: 怎样让 AI 科学加班?
这个框架是字节跳动 Seed 刚发布的 EdgeBench。需要把 AI Agent 放进真实可运行的环境里, 给它时间、工具和反馈, 看它能不能在长达十几小时的迭代中不断改进.
我这次只测了其中一道题, 用的是我本地跑的 35B-A3B模型(4bit量化版本).
测试内容很有意思, 是大名鼎鼎的 DCSS, 全称 Dungeon Crawl Stone Soup. 如果你玩过 Roguelike 游戏, 却没听说过 DCSS、CDDA、ToME4 这三幻神, 兄弟那我只能说快去补课.
且慢, 不用搜, 我快速给大家补一下. 这类游戏都是随机地牢冒险: 你进入地牢后探索地图, 捡装备, 打怪, 尽可能走得更深. EdgeBench 里面用的是命令行版本的 DCSS, 地图、怪物、玩家都用字符表示, 长这样:
#EdgeBench #ScalingLaw #AIAgent #AgentLoop #自我迭代