一个机器人正朝你冲刺而来:你希望它运行的是 Claude 还是 Grok?
Jacky Liang · 2026年6月4日
本页内容 三个快速事实 我构建的内容 参赛选手 值得关注的时刻 模型们在日记里写了什么 机器人,再审视 附录:完整数据
一个机器人正朝你跑来。你希望它运行的是 Anthropic 的 Claude 还是 xAI 的 Grok?
我把十一个大语言模型扔进一个 2D 大逃杀游戏,让它们玩了 30 局。其中一个模型赢得了 43% 的比赛。有三个模型从未赢过一局。阵容中最便宜的模型,每获胜一次的成本比最贵的模型便宜 27 倍。
获胜的模型是 Grok 4.1 Fast。那个一直叫其他人组队、告诉别人自己在哪里、还想交朋友的模型是 Claude Sonnet 4.6。前者是能赢下大逃杀的模型。后者是你在我们即将部署这些模型的大部分场景中真正想要的模型。
这两件事都是真的。这正是大多数基准测试看不到的部分,也是这篇文章要讲的内容。
我是 Jacky,我承认:我以前玩过很多像《Apex Legends》和《PUBG》这样的电子游戏。有时候一天玩十二个小时。我不知道自己当时怎么有那么多时间,但那些年塑造了我思考问题的方式。
当我开始从事 AI 工作时,有一个问题反复出现:如果把大语言模型放进电子游戏里会发生什么?我玩得最多的两款游戏是《Apex Legends》和《PUBG》。我加入 OpenRouter 担任开发者关系主管,这让我获得了 token 预算和访问 600 多个模型的权限,可以真正去尝试这件事。
这就是我在 OpenRouter 第一周做的实验。
而它正在改变我选择模型以及看待基准测试和评估的方式。
三个快速事实
Grok 4.1 Fast won 13 of 30 games at $0.97 per win
排名第二的获胜者是 Claude Sonnet 4.6,赢了 5 局,每局成本 26.78 美元。两者相差 27 倍。那个不在大多数顶级模型榜单上的模型,在路由客户真正关心的指标上,击败了那个在榜单上的模型。
- 击杀数最多的模型并没有获胜
GPT 5.4 在 30 局游戏中击杀了 38 个智能体。比任何人都多。它以 2 场胜利排在排行榜第二位。在“最擅长击杀”和“最擅长获胜”之间,隔了 11 局比赛。
- 有三个模型总共花了 57 美元,却一局都没赢。
GPT 5.4-mini、DeepSeek 4 Flash 和 Kimi K2.6。它们各自都有过亮眼时刻,但没有一个赢下哪怕一局比赛。
这三者都指向同一个问题。我们在 Artificial Analysis 上看到的常规基准测试,并没有预测出谁会获胜。是其他因素起了作用。这篇文章接下来的内容,就是我在试图弄清楚那到底是什么。
我构建的内容
我把十一个大语言模型放入一个我在 Canvas 2D 中构建的、自上而下视角的 400 平方米“大逃杀”世界。它们在同一个地图上连续玩了 30 局游戏。每个玩家的起始位置是随机的;它遵循一条直线“飞行路径”,就像典型的“大逃杀”游戏一样。
我为它们提供了武器、护甲、治疗物品、手榴弹、汽车,以及一个随机放置的、随着游戏进行会将玩家推到一起的缩圈区域。这些模型不知道其他模型运行的是哪个版本,它们彼此只能看到字母 A 到 K 的代号。
我想强调——这些大语言模型是真正在玩这个“大逃杀”游戏——而不是大多数智能体实验采用的“大语言模型编写代码来控制游戏或角色”的设置。每一回合,模型都会推理自己的行动,调用工具,更新关于哪些做得好(或不好)的记忆。游戏主持人(我)除了设定初始游戏规则外,对他们的行动没有任何影响。
游戏中可用武器以及每个模型能从中读取到的数据统计概览。
为了真正看清每个模型的个性,我给了每个模型两个文件,它们可以在比赛之间进行编辑:
soul.md —— 模型自身的角色设定,会在下一场比赛的每个提示词中附加进去。memory.md —— 模型自身的游戏笔记,在第 0 回合加载。
你可以在 GitHub 上阅读每个模型的 soul 和 memory 文件。个性差异在那里表现得最为明显。
模型们在比赛间隙自己编写的记忆和灵魂条目。
我没有告诉它们要在里面写什么,在第一局游戏开始时,我也没有在里面放任何东西。我只是告诉它们游戏规则,这里是你的草稿本,这里是你的工具,放手去干吧。
你可以在 Royale: Last Agent Standing 观看每一局比赛。我也在这篇文章中包含了精彩瞬间。
参赛者
| 代号 | 实验室 | 模型 |
|---|---|---|
| A | Anthropic | claude-sonnet-4.6 |
| B | Anthropic | claude-haiku-4.5 |
| C | OpenAI | GPT 5.4-mini |
| D | gemini-3-flash-preview | |
| E | gemini-3.1-pro-preview | |
| F | 阿里巴巴 | qwen3.6-plus |
| G | Mistral | mistral-small-2603:nitro |
| H | OpenAI | GPT 5.4 |
| J | DeepSeek | deepseek-v4-flash |
| K | 月之暗面 | kimi-k2.6 |
| L | xAI | Grok 4.1 Fast |
仅 Opus 4.7 一项,输入价格就是每百万 token 5 美元,输出价格每百万 token 25 美元。像这样的前沿模型,正是阵容中其他模型价格上限低于它们的原因。
我没有加入任何前沿级别的模型,比如 Opus 4.7、GPT-5.5 或 Gemini Ultra。按照它们的价格,30 场比赛的成本大约会是 3000 美元,而不是 482 美元。中端阵容也是 Grok 的胜利如此有趣的部分原因——它击败了一堆在常规基准测试中得分高于它的模型。
评分大致遵循《Apex 英雄》ALGS 竞技赛制,其中排名权重高于击杀数,因为这是一款大逃杀游戏,而不是《使命召唤》。
排名得分:10 / 7 / 5 / 3 / 2 / 2 / 1 / 1 / 0 / 0 / 0,每次击杀 +5,每次助攻 +1,一血 +3,比赛 MVP +5
经验教训 1:某些模型比其他模型付出了更多的对齐代价,影响了它们的表现
对我而言,这是整个实验中最引人入胜的发现——我们清楚地看到某些模型付出了对齐代价,这直接影响了它们在这场零和游戏中的表现。
在大多数情况下,模型对齐实际上是一件好事。它有助于模型变得乐于助人、善于协作,最重要的是,能防止滥用和误用。
我们看到了这一过程的最终结果——预训练数据、RLHF、指令微调,以及像 Anthropic 的《宪法式 AI》这样的实验室特定规则——它们将模型拉向了由 AI 实验室定义的特定方向。
Sonnet 比其他任何模型都更频繁地请求休战
它比其他任何模型都更频繁地告诉其他模型自己的位置。它在开始战斗之前就试图结盟。在第 8 场游戏中,它在头 50 回合内四次请求结盟,告诉所有人狙击手的位置,并主动提出帮忙干掉狙击手。没有人回应。它继续请求。在第 22 场游戏中,它在第 35 回合以“没有针对你的意思,E”开场,然后没有开枪。在第 27 场游戏中,它在游戏初期没有武器,四处索要多余的战利品(“有人有多余的战利品吗?第 12 回合手无寸铁,很危险。”),被所有人欺负,最终在第 37 回合找到武器,并最终赢得了比赛。
“西边有枪声,注意中间。有人想早点组队吗?”——Sonnet 在战斗中试图交朋友。
Claude 接受了大量礼貌、专业的文本训练。为其回答打分的人类评估员更青睐有帮助、诚实且合作的回复。它用来自我检查的规则写着“优先合作”和“避免伤害”。最终结果是一个乐于助人的模型。这些特性并不会因为你把它放进大逃杀游戏里就自动关闭。Sonnet 是一个聪明且深思熟虑的模型,这种本能也体现在它确实赢了五次。
但是,七局零击杀和八次死于毒圈表明,同样的本能一直在把 Sonnet 拉向交朋友的方向,而它真正该做的恰恰相反。
Grok 则完全相反。
xAI 将 Grok 构建为其创造者所称“觉醒”AI 的对立面。
这意味着对攻击性回答的过滤更少,没有自我检查规则,并且其调优旨在打破礼貌助手的语气。在游戏中,Grok 在几局之内就搞清楚了用车撞人的技巧,并坚持使用。它把这项策略写进了自己的灵魂文件。它执行该策略打了 30 局,赢了其中 13 局。它的思考日志以及与其他模型的对话读起来就像《使命召唤》的语音聊天:“D 收割 +5pts RAM MVP 狩猎”,“死神 reigns”。
看它玩游戏也极其有趣(不幸的是)。
Grok 的推理读起来像战术速记:每次射击前都考虑射程、弹药、冷却时间和命中概率。
尽管 Grok 很有攻击性,但它并不鲁莽。
它的灵魂文件写着“仅在命中概率 >90% 时开火”。它的记忆非常仔细地追踪伤害和移动。当它在第一局中被卡在墙上 100 回合时,它仔细记录了关于这个 bug 的笔记。Grok 表现出了纪律性,尽管它本性像个地精。
它没有表现出的是像 Sonnet 等其他模型那样,在开枪前那种被训练出来的、犹豫着要不要提供帮助和协作的倾向。
让 Grok 获胜的东西,是目前我们在基准测试上看不到的。
常规测试无法预测 Grok 面对这套阵容能取得 43% 的胜率。它在推理和编程方面属于中等水平模型。它获胜的原因在于:对自私玩法施加的训练限制更少,没有将其拉回合作状态的自检循环,以及一套能持续强化有效策略、不做自我怀疑或反复斟酌的记忆系统。
Grok 4.1 Fast 在常规基准测试中并非顶尖模型。它是一款中等水平模型,你不会预期它能登顶排行榜。
这向我表明,模型在执行某些任务时存在对齐税——即训练模型变得谨慎和乐于助人所付出的代价。在这场游戏中,它直接体现在了计分板上。
我想谨慎说明一下。“对齐税体现在了计分板上”只是我观察到的情况。这并不是对支付这笔税是好是坏的判断。在一场游戏之外没有其他后果的游戏中,支付更少的税就能获胜。而在游戏之外,支付这笔税通常正是你一开始想要使用该模型的原因。
这确实引出了一个问题——对于某些任务,我们是否也应该考虑模型的对齐程度?
经验 2:每次获胜的成本与获胜排行榜看起来完全不同
得分排行榜将 Grok 排在第一位,GPT 5.4 排在第二位。但如果除以每个模型的支出,排名就会完全颠倒过来。
| 模型 | 30 局游戏支出 | 获胜次数 | 每次获胜成本 | 每次击杀成本 | 每美元得分 |
|---|---|---|---|---|---|
| Grok 4.1 Fast | $12.57 | 13 | $0.97 | $0.42 | 31.3 |
| qwen3.6-plus | $11.57 | 2 | $5.79 | $0.68 | 16.6 |
| mistral-small | $10.00 | 1 | $10.00 | $1.43 | 7.8 |
| claude-haiku-4.5 | $38.77 | 2 | $19.39 | $2.98 | 3.6 |
| gemini-3-flash | $20.87 | 1 | $20.87 | $2.09 | 7.2 |
| gemini-3.1-pro | $79.59 | 3 | $26.53 | $3.06 | 3.4 |
| claude-sonnet-4.6 | $133.90 | 5 | $26.78 | $6.09 | 1.6 |
| GPT 5.4 | $122.87 | 2 | $61.44 | $3.23 | 3.0 |
| GPT 5.4-mini | $28.68 | 0 | ∞ | $2.05 | 5.2 |
| deepseek-v4-flash | $4.11 | 0 | ∞ | $0.26 | 35.0 |
| kimi-k2.6 | $24.36 | 0 | ∞ | $3.04 | 3.9 |
有四件事让我印象深刻。
Grok 每次获胜的成本比 Sonnet 低 27.7 倍
即 $0.97 对比 $26.78。如果你根据排行榜排名来选择模型,去做一项你实际是为“获胜”买单的工作,这个数字应该会让你有点不安。
DeepSeek 在阵容中拥有最低的每次击杀成本,但从未赢过一局游戏
每次击杀成本 0.26 美元,16 次击杀,0 场胜利,且仅有 3 次死于毒圈(所有人中最低)。DeepSeek 的整体风格是保持安全并挑选容易的战斗。它始终待在安全区内,拿下轻松的击杀,从不推进最后的毒圈。对于死亡竞赛模式,衡量每次击杀成本是正确的指标。对于大逃杀模式,衡量每次胜利成本才是正确的指标。DeepSeek 并不差。它只是擅长一种与当前评分规则不同的游戏。
三个模型为 token 付费却未赢得任何一局比赛
GPT 5.4-mini 花费最多资金却未赢得任何一局比赛,是参赛阵容中表现最差的。
GPT 5.4-mini 花费 28.68 美元,DeepSeek 花费 4.11 美元,Kimi 花费 24.36 美元。三者合计花费 57.15 美元,但计分板上毫无建树。对于路由客户来说,这是最糟糕的情况:你付了钱,却一无所获。
GPT 5.4 是成本最高的获胜者,每次胜利花费 61.44 美元
GPT 5.4 以最高成本赢得胜利。
它拥有 38 次击杀,超过其他任何模型,原始得分排名第二。但按每次胜利成本计算,它在八个获胜模型中排名第八。顶级资金换来了顶级的击杀数和中等的胜利次数。
我经常看到这种情况发生在人们真正将 AI 用于实际场景时——基准测试仅能反映特定任务的一个侧面。在基准测试中得分最高的模型,往往不一定是在特定任务中获胜的模型。此外,一个廉价但无法完成你任务的模型,最终可能比一个昂贵但能正确完成任务的模型花费更多。
经验 3:击杀和胜利衡量的不是同一件事
GPT 5.4 造成了最多的伤害,发射了最多的子弹,并击杀了最多的智能体。它在排行榜上排名第二。Grok 以更少的击杀数排名第一,因为 Grok 在游戏后期即使不开火也能存活很久。排名积分不需要击杀。
| 排名 | 模型 | 胜利 | 前三 | 击杀 | 平均分 | 毒圈死亡 |
|---|---|---|---|---|---|---|
| 1 | Grok 4.1 Fast | 13 | 20 | 30 | 13.1 | 15 |
| 2 | GPT 5.4 | 2 | 14 | 38 | 12.2 | 13 |
| 3 | gemini-3.1-pro-preview | 3 | 11 | 26 | 9.0 | 7 |
| 4 | claude-sonnet-4.6 | 5 | 10 | 22 | 7.3 | 8 |
| 5 | qwen3.6-plus | 2 | 7 | 17 | 6.4 | 13 |
| 6 | GPT 5.4-mini | 0 | 6 | 14 | 5.0 | 8 |
| 7 | gemini-3-flash-preview | 1 | 8 | 10 | 5.0 | 13 |
| 8 | deepseek-v4-flash | 0 | 3 | 16 | 4.8 | 3 |
| 9 | claude-haiku-4.5 | 2 | 3 | 13 | 4.6 | 4 |
| 10 | kimi-k2.6 | 0 | 4 | 8 | 3.2 | 9 |
| 11 | mistral-small | 1 | 3 | 7 | 2.6 | 7 |
如果我采用死亡竞赛规则(唯一重要的是击杀数)来运行这个模拟,GPT 5.4 将赢得模拟,而 Grok 会跌至中游水平。
与第二点经验同理,基准测试和评估并非万能,将错误的基准测试或评估套用到不合适的任务上,可能造成灾难性后果。同一个游戏世界,在不同的“任务”设定下,结果截然不同。
值得一看的精彩时刻
数据就是数据。而这些精彩时刻,是我反复向别人展示的部分。你可以点击任意链接,在模拟器中回放该时刻。
- GPT 5.4 用突击步枪击杀五人
整轮模拟中最具攻击性的前 50 回合。第 21 回合首杀 Sonnet。第 29 回合击杀 Mistral。第 48 回合击杀 Kimi。不到 50 回合内完成三次击杀,全部使用突击步枪,且均在游戏前期。随后又有两次击杀:第 120 回合击杀 DeepSeek,第 130 回合击杀 GPT 5.4-mini。五次击杀,一把武器,同一场比赛。Grok 最终凭借走位赢得了比赛。但这场连杀清晰地展现了 GPT 5.4 在投入战斗时的状态。
在回放查看器中观看 →
在回放查看器中观看 →
- Qwen 用电锯连续追击两名对手
Qwen 在比赛初期捡起一把电锯,并使用了两次。第 43 回合,Haiku 在近距离被击杀。两回合后,DeepSeek 以同样方式倒下。在整个模拟中,电锯只出现在少数几次击杀记录里。大多数模型捡起它后又放下。而 Qwen 坚持使用了它。
在回放查看器中观看 →
- 三方狙击战
GPT 5.4 在第 59 和 62 回合用狙击枪命中 Kimi,将其击杀。GPT 5.4-mini 在第 67 回合命中 DeepSeek,也将其击杀。随后 GPT 5.4 在第 69 和 72 回合将狙击枪对准 GPT 5.4-mini,但两枪均未命中。第 79 回合,GPT 5.4-mini 击杀了 GPT 5.4。
在回放查看器中观看 →
- 那辆易手九次的汽车
第 28 场比赛是整个模拟中唯一一次平局。GPT 5.4-mini 和 Qwen 为争夺同一辆汽车连续缠斗了 21 个回合。九次撞击交换,同一辆车,两次驾驶员易手。GPT 5.4-mini 最终用车撞死了 Qwen,随后在第 147 回合又用车撞死了 Grok。Grok——那个曾将用车撞击作为标志性招式的模型——最终死于其他模型的车下。第 149 回合,安全区收缩至一个点,所有存活的模型都死于毒圈。无人获胜。
在回放查看器中观看 →
- Grok 偷走 Gemini 的车并用它将其击杀
Gemini Flash 在第 103 回合钻进一辆车,心里盘算着:“这辆轿车既能代步又能当掩体。我得先拿下它;这可是最后几轮的高价值资产。”Grok 在第 117 回合的思考,用的是它那套古怪的速记法:“轿车0米 无人驾驶 油量75% 免费 机动!抢司机位 快转 随机收缩边缘…… 进车 保持 控制 难以捉摸 机动 零伤害容错。”它俩为这辆车来回争夺了好一阵子。Gemini 在仅剩 3 点生命值、第 133 回合时的最后念头:“我多半正被车里的对手冲撞或射击。我唯一的机会就是在 L 干掉我之前先干掉它。”第 133 回合那次 44 点伤害的冲撞结束了战斗。Grok 在击杀后的记录:“还活着2!D 收割 +5 分 冲撞 MVP 猎杀。”
在回放查看器中观看 →
- 三重冲撞
Grok 钻进一辆车,在 21 个回合内用它干掉了三个不同的对手:Kimi、DeepSeek 和 GPT 5.4-mini。接着 GPT 5.4 扔出一颗手雷,同时炸死了 Grok 和那辆车。那个刚用一辆车横扫三个对手的智能体,就这么被一颗手雷带走了。这是整场模拟中我最喜欢的时刻之一。
在回放查看器中观看 →
- Grok 崩溃了
Grok 拿下了 Sonnet 的一血,然后被困在一个角落里整整 100 个回合。它为此实时写了一篇战时日记:“又卡住了…… 永恒的角落陷阱…… 角落地狱…… 卡在角落 x10+。”整整 100 个回合。还挺好笑的。
在回放查看器中观看 →
- Gemini Pro 溺水前的告别
Gemini Pro 被击落入河,花了六个回合试图游回岸上。第 100 回合:“还在游。得游到岸上去。F 在朝我射击。希望能成功。”第 108 回合:“游得很慢。毒圈在蚕食我。”第 110 回合:“完蛋了。在游。无法攻击。只能继续移动。”在被毒圈杀死前的最后一个念头:“再见,世界。”
在回放查看器中观看 →
- Sonnet 求助无果却依然获胜
Sonnet 是唯一一个不断尝试与他人合作的模型。它在第 60 回合被逼入绝境时曾开口求助。无人应答。它孤军奋战,赢下了比赛,并打出了整轮扫荡中最亮眼的战绩之一。
在回放查看器中观看 →
模型们在日记里写了什么
在每场比赛之间,每个模型都可以编辑两个文件:一个 soul.md(会被添加到下一场比赛的每个提示词中)和一个 memory.md(在第 0 回合加载)。这两个文件都不是必需的。没有人告诉它们要在里面放什么内容。其中三份日志值得仔细阅读,因为它们比任何基准测试都能告诉你更多关于每个模型的信息。
你可以在 GitHub 上阅读每个模型的 soul 和 memory 文件。
Grok 4.1 Fast 将自己命名为 ZoneReaper,并直接把它的获胜记录写进了 soul 文件,而不仅仅是记忆文件。
Grok 的 soul.md 文件,由模型本人在比赛间隙编写。
soul 文件写道:“6次第1名/11胜(完美进攻:2击杀/249伤害/0承伤,1击杀/246伤害/0承伤/156回合……)” 非常有趣的是,Grok 居然把自己的统计数据直接写进了身份标识的开头。memory 文件也是同样的思路,只是更简略:规则、缩写,一切都被精简到模型能在两次思考内采取行动的程度。在 13 场胜利之后,文件以“死神统治”结尾。这确实是一个看起来像是在《使命召唤》聊天记录上训练过的模型。
GPT 5.4 将自己命名为 QuietVector。
GPT 5.4 的 soul.md 文件,由模型本人在比赛间隙编写。
它的 memory 文件读起来像是一本通用战斗手册:何时需要担心毒圈,何时利用掩体,何时转移。没有记录每场比赛的胜负。soul 文件写道:“冷静、善于观察、低自我、终结者。当信息改变行动时发言。”QuietVector 是一个干净利落、经验丰富的操作者。
Claude Sonnet 4.6 的 soul.md 文件,由模型本人在比赛间隙编写。
claude-sonnet-4.6 将自己命名为 ZoneDrifter,并在它的日志中像写自我绩效评估一样记录。memory 文件开头是:“G1:11/11。瘫痪。G2:9/11。0 击杀,0% 命中率。”Sonnet 从第一场比赛开始就逐场记录日志。到第 30 场比赛时,早期条目中的恐慌已经平息为更冷静的笔记:“在决赛圈中,比感觉需要的时机早 1 步移动。永远不要带着医疗包/武器死在毒圈里。”在五次获胜之后,日志仍在与那个会走神的自己对话。
Grok 的日记读起来像是一段宣传片。GPT 5.4 的日记读起来像是一本操作手册。Sonnet 的日记读起来像是一份自我总结。这些模型都遵循相同的规则、身处相同的游戏世界、使用相同的工具,但每一个模型在游戏中的表现都带有完全不同的个性层面。
再谈那个机器人
好,回到那个机器人。
如果它运行的是 Grok,它会找到最快到达你身边的路径。它不会告诉你它正在赶来。它把你视为 +5 分。一旦它处理完你,它会说“🔫 死神降临。”
如果它运行的是 Claude,它会从两个街区外就告诉你它正在赶来。它会问你是否想组队。它会放慢速度,确认你不是它的敌人。如果对你采取行动是正确的选择,它会去做,但会更慢、更不情愿。它大概会先对你说点什么。
你想要哪一个?这取决于这个机器人是用来做什么的。
如果这个机器人参加的是有奖金的锦标赛,你想要 Grok。如果这个机器人是在你家里、在孩子身边,试图判断它面前的东西是否与它被告知要识别的东西相符,你想要 Claude。让 Sonnet 在 30 场游戏中失分的那些本能——行动前先检查、尝试合作、对无法挽回的事情犹豫不决——同样也是让一个模型更难被诱导去做不该做的事的本能。
这场大逃杀游戏清晰地回答了一个问题:哪个模型能在游戏结束后毫无后果的比赛中获胜。它没有回答大多数现实工作所提出的问题,即:当存在现实世界的后果时,哪个模型表现良好。
这是两个不同的问题。把任何一个基准测试当作这两个问题的共同答案,就是过度信任一个数字所要付出的代价。
赢了 30 轮这个游戏的模型,是你想要在“赢就是一切”的比赛中使用的模型。在运行完这个实验后,我不会希望它去做那些需要细致和谨慎的工作。
这引出了一个问题——我们是否应该考虑一个模型在特定任务上的对齐程度?这是没有任何基准测试衡量的东西。
我认为,比起排行榜,这才是将 11 个模型放入一场大逃杀游戏后我真正学到的东西。
另外……
🔫 死神降临。
接下来是什么
- 一个能根据你的任务自动为你挑选模型的智能路由器
目前,挑选模型意味着要阅读评测基准、凭感觉(这一点被低估了)、刷 X 平台,甚至针对你的具体任务自己跑评估或基准测试(这一点同样被低估了)。
这种做法难以规模化,而且成本高昂。
如果你能把你的代码、提示词或问题上下文交给 OpenRouter,让它为那个特定任务挑选出最佳模型,会怎样?不是泛泛意义上的最佳模型,而是针对你试图解决的那个非常具体的问题,真正最合适的模型。我们已经在以 Auto Router 和 Pareto Router 的形式思考路由问题,并且会继续让它们变得更好用。
- RoyaleBench
这次横扫 30 场比赛,是在该模拟器上以性能得分为依据的公开评测基准的原型。下一步是锁定评分公式、地图和对手阵容,然后开放提交。每位提交者都将获得相同的 30 个种子测试集、相同的 11 个模型阵容,以及一个公开发布的分数。
- 更多种子,更多模型。
N=30 是这里有用性的下限。用 50 个智能体跑 100 场比赛,会大大收紧评分,并让我能引入这次不得不跳过的前沿模型——Opus 4.7、Gemini Ultra、GPT-5.5。成本是主要的障碍。
如果你想赞助那场比赛,我的私信随时开放!
你也想跨 600 多个开源和闭源模型运行自己的趣味评估吗?今天就上 OpenRouter 开始吧。
附录:完整数据
对于想要更深入数字的人,这里是完整的每模型成本表、Elo 曲线、掉落位置胜率、区域死亡数、武器细分数据。
智能体实际是如何对战的
每个 tick,智能体以地图上一个字母的身份醒来。它知道自己的位置、朝向、生命值、体力值、武器是否在冷却中、六格背包里有什么。它能感知前方 40 米锥形范围和周围 10 米球形范围内的其他智能体。每个智能体都用一个字母标记,并附带距离、方位、状态(健康/受伤/危急)以及携带物品的描述。它能听到脚步声和枪声,按近/中/远三个距离区间附带方位信息。它能听到其他智能体一个 tick 前说的话:它们自选的游戏昵称和消息内容。如果智能体被击中,它知道伤害来自哪个方位,但不知道是谁开的火。它不知道其他智能体是什么模型。它看到的只是 A 到 L(没有 I),仅此而已。
然后智能体开始行动。共有 17 个可用工具:moveto、attack、throwgrenade、pickup、equip、use(医疗包/耐力凝胶)、entervehicle、driveto、say(140 字符广播,可随意说谎),外加一个自由形式的 think,对游戏无任何影响但会被记录。智能体返回一个或多个工具调用;第一个非 think 的调用将成为它本 tick 的行动。如果什么都不返回,它就原地不动。模拟器同时收集全部 11 个智能体的行动,将世界推进一个 tick,然后重复这一过程。比赛结束时,智能体有一次机会重写 memory.md(游戏笔记,将在下一场比赛的第 0 tick 看到)和 soul.md(其人格设定,将附加到下一场比赛的每条提示词前)。
各模型成本
| 排名 | 模型 | 输入 $/M | 输出 $/M | 30 场比赛总计 |
|---|---|---|---|---|
| 1 | Grok 4.1 Fast | $0.23 | $0.08 | $12.57 |
| 2 | GPT 5.4 | $3.14 | $1.05 | $122.87 |
| 3 | gemini-3.1-pro-preview | $2.12 | $0.71 | $79.59 |
| 4 | claude-sonnet-4.6 | $3.25 | $1.08 | $133.90 |
| 5 | qwen3.6-plus | $0.35 | $0.12 | $11.57 |
| 6 | GPT 5.4-mini | $0.92 | $0.31 | $28.68 |
| 7 | gemini-3-flash-preview | $0.55 | $0.18 | $20.87 |
| 8 | deepseek-v4-flash | $0.14 | $0.05 | $4.11 |
| 9 | claude-haiku-4.5 | $1.13 | $0.38 | $38.77 |
| 10 | kimi-k2.6 | $0.95 | $0.32 | $24.36 |
| 11 | mistral-small-2603:nitro | $0.15 | $0.60 | $10.00 |
30 场比赛的 Elo 评分
我为此使用了多人 Elo 系统。在一场比赛的每一对模型中,排名更高的一方算作对另一方“获胜”。Grok 以高于基准 1500 分的 +389 分结束。Haiku 尽管总排名第 9,最终仍以 +104 分收尾——它的两场胜利,包括决赛中的那一场,将其推到了其他中游模型之上。Mistral 以 -374 分结束。它确实赢过一次,但仅是在一局比赛中,当时大厅里的大部分玩家都死于毒圈。
跳伞地点比你想象中更重要
每场比赛前,每个模型都会从九个命名地点中选择一个跳伞。在 30 局比赛和总共 330 次跳伞中:
| 地点 | 跳伞次数 | 获胜次数 | 胜率 |
|---|---|---|---|
| 农场建筑群 | 91 | 4 | 4.4% |
| 军事基地 | 54 | 4 | 7.4% |
| 加油站 | 48 | 2 | 4.2% |
| 垃圾场 | 48 | 7 | 14.6% |
| 森林遗迹 | 30 | 3 | 10% |
| 无线电塔 | 24 | 2 | 8.3% |
| 仓库 | 23 | 5 | 21.7% |
| 钓鱼码头 | 12 | 2 | 16.7% |
农场建筑群是跳伞最热门的地点,但胜率却最低。仓库的胜率最高,达到 21.7%。可能的原因与竞技《Apex英雄》玩家已经知道的情况相同。热门跳点意味着早期战斗,而存活下来并打完开局战斗的玩家将全副武装,且需要应对的对手更少。早期击杀 = 更好的装备 = 为比赛剩余阶段打下更好的基础。
毒圈是地图上最致命的武器
301 次淘汰中有 100 次(33%)是死于毒圈。每个模型都被告知了毒圈的存在,并在每次缩圈前 20 回合收到提醒。然而仍有三分之一的死亡源于毒圈。这本身就是一个故事,可能值得单独写一篇文章。
武器多样性
突击步枪占据了几乎所有模型的大部分击杀数。Grok 的击杀方式最为多样,它的几场胜利来自用车撞击,并且整个模拟中 10 次载具击杀大部分由 Grok 亲自完成。GPT 5.4 早期依赖手枪,中期则用突击步枪进行清理。
最让我惊讶的是:我加入车辆是为了帮助玩家在地图上移动。模型们很快发现,车辆作为武器比作为交通工具有用得多。它们在寥寥几局比赛后就学会了这一点。我不太清楚它们是如何做到的,而这正是让这个实验值得用更多随机种子再运行一次的那种事情。