字节Seed发布EdgeBench,科学测试长程AI Agent

karminski-牙医 · @karminski3 · X·2026-07-06 18:48·56天前
AI 导读

字节跳动Seed发布EdgeBench评测框架,用于衡量AI Agent在真实环境中的长程任务表现——给Agent时间、工具和反馈,观察其能否在十几小时的迭代中持续改进。推文作者使用本地35B-A3B模型(4bit量化版本)测试了其中一道题,任务为命令行版地牢爬行游戏DCSS。该框架旨在探讨:让AI“科学加班”而非单纯延长运行时间,才能获得更好的结果。

karminski-牙医@karminski3
39AI 编辑部评分,满分 100

字节Seed发布EdgeBench,科学测试长程AI Agent

2026-07-06 18:48· 56天前
AI 导读

字节跳动Seed发布EdgeBench评测框架,用于衡量AI Agent在真实环境中的长程任务表现——给Agent时间、工具和反馈,观察其能否在十几小时的迭代中持续改进。推文作者使用本地35B-A3B模型(4bit量化版本)测试了其中一道题,任务为命令行版地牢爬行游戏DCSS。该框架旨在探讨:让AI“科学加班”而非单纯延长运行时间,才能获得更好的结果。

为什么现在大家都在讨论长程任务? 难道让 AI 不断"加班", 就一定能得到更好的结果吗?

Nope!

我平时会拆解很多 AI 评测框架, 给大家不断丰富测试内容, 让大家更全面地理解现在 AI 的真实能力. 今天我刚测过的这个框架就很适合回答这个问题: 怎样让 AI 科学加班?

这个框架是字节跳动 Seed 刚发布的 EdgeBench。需要把 AI Agent 放进真实可运行的环境里, 给它时间、工具和反馈, 看它能不能在长达十几小时的迭代中不断改进.

我这次只测了其中一道题, 用的是我本地跑的 35B-A3B模型(4bit量化版本).

测试内容很有意思, 是大名鼎鼎的 DCSS, 全称 Dungeon Crawl Stone Soup. 如果你玩过 Roguelike 游戏, 却没听说过 DCSS、CDDA、ToME4 这三幻神, 兄弟那我只能说快去补课.

且慢, 不用搜, 我快速给大家补一下. 这类游戏都是随机地牢冒险: 你进入地牢后探索地图, 捡装备, 打怪, 尽可能走得更深. EdgeBench 里面用的是命令行版本的 DCSS, 地图、怪物、玩家都用字符表示, 长这样:

#EdgeBench #ScalingLaw #AIAgent #AgentLoop #自我迭代

来源:karminski-牙医· x.com