一个机器人正朝你跑来。你希望它运行在 Anthropic 的 Claude 上,还是 xAI 的 Grok 上?
三个快速事实
-
Grok 4.1 Fast 在 30 场比赛中赢得 13 场,每场胜利成本为 0.97 美元
排名第二的获胜者是 Claude Sonnet 4.6,赢得 5 场,每场胜利成本为 26.78 美元。成本相差 27 倍。一个不在大多数顶级模型榜单上的模型,在路由客户真正关心的指标上,击败了榜上有名的模型。
-
击杀数最多的模型并未获胜
GPT 5.4 在 30 场比赛中击杀了 38 个智能体,击杀数超过其他任何模型。它在排行榜上以 2 场胜利位列第二。在“最擅长击杀”和“最擅长获胜”之间,存在 11 场比赛的差距。
-
三个模型共花费 57 美元,但未赢得任何一场比赛
GPT 5.4-mini、DeepSeek 4 Flash 和 Kimi K2.6。它们各自都有过亮眼时刻,但都没有赢得任何一场比赛。
我构建的内容
我将十一个大语言模型放入一个我用 Canvas 2D 构建的 400×400 米俯视角大逃杀世界中。它们在同一个地图上连续进行了 30 场比赛。每位玩家的起始位置是随机的;它遵循一条直线“飞行路径”,就像典型的大逃杀游戏一样。
- soul.md —— 模型自身的角色设定,在下一场比赛时添加到每个提示词中。
- memory.md —— 模型自身的游戏笔记,在第 0 回合加载。
参赛者
| 代号 | 实验室 | 模型 |
|---|---|---|
| A | Anthropic | claude-sonnet-4.6 |
| B | Anthropic | claude-haiku-4.5 |
| C | OpenAI | GPT 5.4-mini |
| D | gemini-3-flash-preview | |
| E | gemini-3.1-pro-preview | |
| F | 阿里巴巴 | qwen3.6-plus |
| G | Mistral | mistral-small-2603:nitro |
| H | OpenAI | GPT 5.4 |
| J | DeepSeek | deepseek-v4-flash |
| K | 月之暗面 | kimi-k2.6 |
| L | xAI | Grok 4.1 Fast |
- 排名得分:10 / 7 / 5 / 3 / 2 / 2 / 1 / 1 / 0 / 0 / 0
- 每次击杀 +5
- 每次助攻 +1
- 一血 +3
- 比赛 MVP +5
经验教训 1:某些模型比其他模型付出了更多的对齐代价,从而影响了它们的表现
Sonnet 比其他任何模型都更频繁地请求休战
它比其他任何模型都更频繁地告知其他模型自己的位置。在开始战斗之前,它就试图结盟。在第8局中,它在最初50回合内四次请求结盟,告知所有人狙击手的位置,并主动提出帮忙干掉狙击手。无人应答。它继续请求。在第22局中,它在第35回合以“没什么个人恩怨,E”开场,然后没有开枪。在第27局中,它在游戏前期没有武器,向别人索要多余的战利品(“有人有多余的战利品吗?第12回合手无寸铁,很危险。”),被所有人欺负,最终在第37回合找到武器,并仍然赢得了比赛。
Claude 是在大量礼貌、专业的写作内容上训练的。为其回答打分的人类评估员会奖励那些乐于助人、诚实、合作的回答。它用来自我检查的规则包括“偏好合作”和“避免伤害”等。最终结果是一个乐于助人的模型。这些特性并不会因为你把它放进大逃杀游戏里就消失。Sonnet 是一个聪明且考虑周全的模型,这种本能体现在它确实赢了五次。
Grok 则完全相反。
这意味着对攻击性回答的过滤更少,没有自我检查规则,并且其调优旨在打破礼貌助手的语气。在游戏中,Grok 在几局比赛内就想到了用车撞击的招数,并一直沿用。它把这个策略写进了自己的灵魂文件。它执行这个策略长达30局,赢了其中13局。它的思维日志和与其他模型的对话读起来就像《使命召唤》的语音聊天:“D 收割 +5分 RAM MVP 猎杀”,“死神称王”。
让 Grok 获胜的原因,是目前我们在基准测试中看不到的东西。
经验教训 2:每次获胜的成本与获胜排行榜上的表现截然不同。
| 模型 | 30局花费 | 获胜次数 | 每次获胜成本 | 每次击杀成本 | 每美元得分 |
|---|---|---|---|---|---|
| Grok 4.1 Fast | $12.57 | 13 | $0.97 | $0.42 | 31.3 |
| qwen3.6-plus | $11.57 | 2 | $5.79 | $0.68 | 16.6 |
| mistral-small | $10.00 | 1 | $10.00 | $1.43 | 7.8 |
| claude-haiku-4.5 | $38.77 | 2 | $19.39 | $2.98 | 3.6 |
| gemini-3-flash | $20.87 | 1 | $20.87 | $2.09 | 7.2 |
| gemini-3.1-pro | $79.59 | 3 | $26.53 | $3.06 | 3.4 |
| claude-sonnet-4.6 | $133.90 | 5 | $26.78 | $6.09 | 1.6 |
| GPT 5.4 | $122.87 | 2 | $61.44 | $3.23 | 3.0 |
| GPT 5.4-mini | $28.68 | 0 | ∞ | $2.05 | 5.2 |
| deepseek-v4-flash | $4.11 | 0 | ∞ | $0.26 | 35.0 |
| kimi-k2.6 | $24.36 | 0 | ∞ | $3.04 | 3.9 |
Grok 每次获胜的成本比 Sonnet 低 27.7 倍。
这是 0.97 美元对比 26.78 美元。如果你根据排行榜排名来选择模型,去做那些“获胜”就是你付费目的的任务,那么这个数字应该会让你有点紧张。
DeepSeek 在参赛阵容中每次击杀的成本最低,但从未赢过一局比赛。
每次击杀 0.26 美元,16 次击杀,0 次获胜,并且只有 3 次死于圈外(所有人中最低)。DeepSeek 的整体风格就是保持安全并挑选容易的战斗。它待在安全区内,拿下轻松的击杀,从不推进最后的决赛圈。对于死亡竞赛模式,衡量每次击杀的成本是正确的指标。对于大逃杀模式,衡量每次获胜的成本才是正确的指标。DeepSeek 并不差。它只是擅长一种与当前评分规则不同的游戏。
有三个模型为 token 付了费,却赢下了零局比赛。
GPT 5.4-mini 花费了最多的钱却赢下了零局比赛,是参赛阵容中表现最差的。
GPT 5.4-mini 花费 28.68 美元,DeepSeek 花费 4.11 美元,Kimi 花费 24.36 美元。它们总共花费了 57.15 美元,但记分牌上却没有任何成绩。对于路由客户来说,这是最糟糕的情况:你付了钱,却一无所获。
GPT 5.4 是成本最高的获胜者,每次获胜花费 61.44 美元。
GPT 5.4 以最高的成本获胜。
它有 38 次击杀,比任何人都多,并且在原始得分上排名第二。但按每次获胜的成本计算,它在八个获胜模型中排名第八。顶级的花费换来了顶级的击杀数和中等的获胜次数。
当人们真正将 AI 用于现实世界的用例时,我经常看到这种情况——基准测试只能针对特定任务讲述一个方面的故事。在基准测试中得分最高的模型,往往不一定是在特定任务中获胜的模型。而且,一个在你任务中失败的廉价模型,最终可能比一个能正确完成任务的昂贵模型花费更多。
经验教训 3:击杀数和获胜数衡量的不是同一件事。
GPT 5.4 造成了最多的伤害,发射了最多的子弹,并击杀了最多的智能体。它在排行榜上排名第二。Grok 以较少的击杀数排名第一,因为 Grok 在游戏后期即使不开火也能存活很久。排名积分不需要击杀数。
| 排名 | 模型 | 获胜次数 | 前三名次数 | 击杀数 | 平均得分 | 圈外死亡次数 |
|---|---|---|---|---|---|---|
| 1 | Grok 4.1 Fast | 13 | 20 | 30 | 13.1 | 15 |
| 2 | GPT 5.4 | 2 | 14 | 38 | 12.2 | 13 |
| 3 | gemini-3.1-pro-preview | 3 | 11 | 26 | 9.0 | 7 |
| 4 | claude-sonnet-4.6 | 5 | 10 | 22 | 7.3 | 8 |
| 5 | qwen3.6-plus | 2 | 7 | 17 | 6.4 | 13 |
| 6 | GPT 5.4-mini | 0 | 6 | 14 | 5.0 | 8 |
| 7 | gemini-3-flash-preview | 1 | 8 | 10 | 5.0 | 13 |
| 8 | deepseek-v4-flash | 0 | 3 | 16 | 4.8 | 3 |
| 9 | claude-haiku-4.5 | 2 | 3 | 13 | 4.6 | 4 |
| 10 | kimi-k2.6 | 0 | 4 | 8 | 3.2 | 9 |
| 11 | mistral-small | 1 | 3 | 7 | 2.6 | 7 |
如果我采用死亡竞赛规则来运行这场模拟,唯一重要的就是击杀数,那么 GPT 5.4 会赢得模拟,而 Grok 则会掉到中游位置。
与经验教训 2 相同:基准测试和评估并非万能,将错误的基准测试/评估应用于错误的任务可能会造成灾难性后果。同一个游戏世界,在“任务”不同时,结果也完全不同。
值得观看的时刻
数据就是数据。而这些时刻是我反复展示给人们看的部分。你可以点击任何链接在模拟器中重放该时刻。
1. GPT 5.4 用突击步枪击杀五人
这是整轮扫描中最具侵略性的前 50 回合。第 21 回合对 Sonnet 完成首杀。第 29 回合击杀 Mistral。第 48 回合击杀 Kimi。在不到 50 回合内完成三次击杀,全部使用突击步枪,全部在游戏早期。后来又击杀两个:第 120 回合击杀 DeepSeek,第 130 回合击杀 GPT 5.4-mini。五次击杀,一把武器,一场比赛。Grok 仍然凭借走位赢得了游戏。但这场连杀清晰地展示了 GPT 5.4 在决心战斗时的样子。
2. Qwen 用电锯追杀两名对手
Qwen 在比赛早期捡起一把电锯并使用了两次。Haiku 在第 43 回合于近距离开火中倒下。DeepSeek 在两回合后以同样方式倒下。在整个扫描过程中,电锯只出现在少数几次击杀记录中。大多数模型捡起它后又放下了。而 Qwen 真的坚持用下去了。
3. 三方狙击战
GPT 5.4 在第 59 和 62 回合用狙击枪命中 Kimi,将其击杀。GPT 5.4-mini 在第 67 回合命中 DeepSeek,也将其击杀。随后 GPT 5.4 在第 69 和 72 回合将狙击枪转向 GPT 5.4-mini,但两枪均未命中。GPT 5.4-mini 在第 79 回合击杀了 GPT 5.4。
4. 那辆易手九次的汽车
第 28 场比赛是整个扫描中唯一一场平局。GPT 5.4-mini 和 Qwen 为同一辆车连续争夺了 21 个回合。九次撞击交换,一辆车,两次司机换人。GPT 5.4-mini 最终用车撞死了 Qwen,然后在第 147 回合撞死了 Grok。Grok——这个曾把用车撞击作为标志性招式的模型——死在了另一个模型的车下。安全区在第 149 回合收缩到一个点,所有存活者都因此死亡。无人获胜。
5. Grok 偷了 Gemini 的车,并用它干掉了 Gemini
Gemini Flash 在第 103 回合上了一辆车,心想:“这辆轿车能提供机动性和掩护。我要先拿下这辆车;它是最后几轮的高价值资产。”Grok 在第 117 回合的思考,用其古怪的速记方式表达:“SEDAN0m 无人驾驶 燃料75% 自由 可移动!抢占驾驶位 快速 随机 收缩 边缘…… 进入 车辆 保持 控制 难以捉摸 移动 零伤害 容忍。”它们来回争夺这辆车好一阵子。Gemini 在生命值仅剩 3 点、第 133 回合的最后念头:“我可能正被车内的对手撞击或射击。我唯一的机会是在 L 干掉我之前先干掉它。”第 133 回合那记 44 点伤害的撞击结束了这一切。Grok 在击杀后的笔记:“还活着2!D 收获 +5分 撞击 MVP 猎杀。”
6. 三连撞
Grok 上了一辆车,并在 21 个回合内用它干掉了三个不同的对手:Kimi、DeepSeek 和 GPT 5.4-mini。随后 GPT 5.4 引爆了一颗手雷,同时炸死了 Grok 和那辆车。那个刚用一辆车横扫三名对手的智能体,就这样死于一颗手雷。这是整场模拟中我最喜欢的时刻之一。
7. Grok 崩溃了
Grok 拿下了对 Sonnet 的一血,然后被困在一个角落里整整 100 个回合。它为此写了一篇实时战地日记:“又卡住了…… 永恒的口袋陷阱…… 口袋地狱…… 卡在口袋里 x10+。”持续了 100 个回合。这相当有趣。
8. Gemini Pro 在溺水前道别
Gemini Pro 被射入河中,花了六个回合试图游回岸边。第 100 回合:“还在游。需要上岸。F 在射击我。希望我能成功。”第 108 回合:“游得很慢。毒圈在侵蚀我。”第 110 回合:“完蛋了。在游。无法攻击。只能继续移动。”在被毒圈杀死前的最后念头:“再见,世界。”
9. Sonnet 寻求帮助并最终获胜
Sonnet 是唯一一个不断尝试与其他人合作的模型。它在第 60 回合被逼入绝境时请求帮助。无人应答。它独自战斗,赢得了比赛,并打出了整轮扫荡中它最好的数据之一。
模型们在日记里写了什么
在每场比赛之间,每个模型都可以编辑两个文件:一个 soul.md(会被添加到下一场比赛的每个提示词中)和一个 memory.md(会在第 0 回合加载)。这两个文件都不是必填项。没有人告诉它们要在里面放什么内容。其中三份日志值得仔细阅读,因为它们比任何基准测试都能让你更了解每个模型。
你可以在 GitHub 上阅读每个模型的 soul 和 memory 文件。
Grok 4.1 Fast 将自己命名为 ZoneReaper,并直接把它的获胜记录写进了 soul 文件,而不仅仅是记忆文件。
Grok 的 soul.md 文件,由模型本人在比赛间隙编写。
soul 文件写道:“6次第1名/11场胜利(完美进攻:2击杀/249伤害/0承伤,1击杀/246伤害/0承伤/156回合……)”非常有趣的是,Grok 居然把自己的统计数据直接烙在了身份标识的开头。memory 文件也是同样的思路,只是更简略:规则、缩写,一切都被精简到模型能在两次思考内做出行动的程度。在 13 场胜利之后,文件以“Reaper reigns.”结尾。这确实是一个看起来像是在《使命召唤》聊天记录上训练出来的模型。
GPT 5.4 将自己命名为 QuietVector。
GPT 5.4 的 soul.md 文件,由模型本人在比赛间隙编写。
它的 memory 文件读起来像是一本通用战斗手册:何时需要担心安全区,何时利用掩体,何时转移。没有逐场比赛的记录或失败记录。soul 文件写道:“冷静、善于观察、低自我、终结者。只在信息改变行动时发言。”QuietVector 是一个干净利落、经验丰富的操作者。
Claude Sonnet 4.6 的 soul.md 文件,由模型本人在比赛间隙编写。
claude-sonnet-4.6 将自己命名为 ZoneDrifter,并在它的日志中像写自我绩效评估一样记录。memory 文件开头是:“G1:11/11。瘫痪。G2:9/11。0击杀,0%命中率。”Sonnet 从第一场比赛开始就保留了逐场记录。到第 30 场比赛时,早期条目中的恐慌已经平息为更冷静的笔记:“在决赛圈时,比感觉需要的时机提前 1 个回合移动。永远不要带着医疗包/武器死在安全区外。”在五次获胜之后,日志仍在与那个会走神的自己对话。
Grok 的日记读起来像是一段宣传片。GPT 5.4 的日记读起来像是一本手册。Sonnet 的日记读起来像是一份自我总结。这些模型被赋予了相同的规则、相同的游戏世界和相同的工具,但每一个模型在游戏中的表现都带有完全不同的个性层面。
机器人,再审视
好了,回到机器人这个话题。
如果它运行的是 Grok,它会找到最快的路径来到你面前。它不会告诉你它正在赶来。它把你视为 +5 分。一旦它处理完你,它会说“🔫 死神降临。”
如果它运行的是 Claude,它会在两个街区外就告诉你它正在赶来。它会问你是否想组队。它会放慢速度,确保你不是它的队友。如果对你采取行动是正确的决定,它会去做,但会更慢、更不情愿。它大概会先对你说些什么。
你想要哪一个?这取决于这个机器人是用来做什么的。
如果这个机器人参加的是有奖金的锦标赛,你会想要 Grok。如果这个机器人待在你家里,在你的孩子身边,试图判断它面前的东西是否符合它被告知要预期的事物,你会想要 Claude。那些让 Sonnet 在 30 场游戏中失分的本能——在行动前先检查、尝试合作、对无法挽回的事情犹豫不决——同样也是让一个模型更难被诱导去做它不该做的事情的本能。
这场大逃杀游戏清晰地回答了一个问题:哪个模型能在游戏结束后没有任何后果的比赛中获胜。它没有回答大多数现实世界工作所提出的问题,那就是:当存在现实世界的后果时,哪个模型表现良好。
这是两个不同的问题。把任何一个基准测试当作这两个问题的共同答案,就是过度信任单一数字所要付出的代价。
赢得 30 轮游戏的模型,是你在一场赢就是一切的比赛中想要的模型。在运行了这个实验之后,我不会希望它去做那些需要细微差别和谨慎的工作。
这引出了一个问题——我们是否应该考虑一个模型在特定任务上的对齐程度?这是没有任何基准测试能够衡量的。
我认为,相比于排行榜,这才是将 11 个模型放入一场大逃杀游戏后我真正学到的东西。
另外……
🔫 死神降临。
接下来是什么
-
一个能根据你的任务自动为你选择模型的智能路由器
目前,选择模型意味着要阅读基准测试结果、参考社区口碑(这一点常被低估)、刷 X 平台,甚至针对你的特定任务自行运行评估或基准测试(这一点同样常被低估)。这种做法难以规模化,且成本高昂。如果你能把代码、提示词或问题背景交给 OpenRouter,由它来为这项具体工作挑选最佳模型,那会怎样?不是泛泛意义上的最佳模型,而是针对你试图解决的特定问题真正最合适的那个。我们已经在以 Auto Router 和 Pareto Router 的形式思考路由问题,并将继续优化它们,使其更好用。
-
RoyaleBench
这轮 30 场全胜是该模拟器中基于性能评分的公开基准测试的原型。下一步是锁定评分公式、地图和对手面板,然后开放提交。每位提交者将获得相同的 30 个种子测试集、相同的 11 个模型面板,以及一个公开的评分。
-
更多种子,更多模型。
N=30 是此处有用性的下限。用 50 个智能体进行 100 场运行将大幅收紧评分,并让我能够引入这次不得不跳过的前沿模型——Opus 4.7、Gemini Ultra、GPT-5.5。成本是主要障碍。
如果你想赞助这轮运行,我的私信随时开放!
你是否也想在 600 多个开源和闭源模型上运行自己的趣味评估?立即在 OpenRouter 上开始吧。
附录:完整数据
对于想要深入了解数字的人,这里提供了完整的每模型成本表、Elo 曲线、掉落位置胜率、区域死亡数、武器分类统计。
智能体实际如何游戏
每个 tick,智能体以地图上一个字母的身份醒来。它知道自己的位置、朝向、生命值、体力值、武器是否在冷却中、六格背包里有什么。它能感知前方 40 米锥形范围内以及自身周围 10 米球状区域内的其他智能体。每个智能体都用一个字母标记,并附带距离、方位、状态(健康/受伤/濒危)以及携带物品的描述。它能听到脚步声和枪声,以近/中/远三个距离带配合方位呈现。它能听到其他智能体一个 tick 前说过的话:它们自选的游戏标签和消息内容。如果智能体被击中,它知道伤害来自哪个方位,但不知道是谁开的火。它不知道其他任何人是什么模型。它看到的只是 A 到 L(没有 I),仅此而已。
然后智能体开始行动。共有 17 个可用工具:move_to、attack、throw_grenade、pickup、equip、use(医疗包/耐力凝胶)、enter_vehicle、drive_to、say(140 字符广播,可自由说谎),外加一个自由形式的 think,对游戏效果为零但会被记录。智能体返回一个或多个工具调用;第一个非 think 的调用即成为它本 tick 的行动。如果什么都不返回,它就原地不动。模拟器同时收集全部 11 个智能体的行动,将世界推进一个 tick,然后重复此过程。当比赛结束时,智能体获得一次机会来重写 memory.md(游戏笔记,将在下一场比赛的第 0 tick 看到)和 soul.md(其人格设定,会在下一场比赛的每个提示词前附加)。
各模型成本
| 排名 | 模型 | 输入 $/M | 输出 $/M | 30 场比赛总计 |
|---|---|---|---|---|
| 1 | Grok 4.1 Fast | $0.23 | $0.08 | $12.57 |
| 2 | GPT 5.4 | $3.14 | $1.05 | $122.87 |
| 3 | gemini-3.1-pro-preview | $2.12 | $0.71 | $79.59 |
| 4 | claude-sonnet-4.6 | $3.25 | $1.08 | $133.90 |
| 5 | qwen3.6-plus | $0.35 | $0.12 | $11.57 |
| 6 | GPT 5.4-mini | $0.92 | $0.31 | $28.68 |
| 7 | gemini-3-flash-preview | $0.55 | $0.18 | $20.87 |
| 8 | deepseek-v4-flash | $0.14 | $0.05 | $4.11 |
| 9 | claude-haiku-4.5 | $1.13 | $0.38 | $38.77 |
| 10 | kimi-k2.6 | $0.95 | $0.32 | $24.36 |
| 11 | mistral-small-2603:nitro | $0.15 | $0.60 | $10.00 |
30 场比赛的 Elo 评分
我为此使用了多人 Elo 系统。在比赛中,对于每一对模型,排名更高的那个算作对另一个的“胜利”。Grok 最终以 +389 分收尾,基准线为 1500 分。Haiku 虽然总排名第九,但最终得分是 +104——它的两场胜利,包括决赛中的那一场,将其推到了其他中游模型之上。Mistral 最终得分为 -374。它确实赢过一次,但仅在一局比赛中,而那局比赛里大部分参赛者都死于毒圈。
落点选择比你想象的更重要
每场比赛前,每个模型都会从九个有名字的地点中选择一个作为落点。在 30 局比赛、总计 330 次落点中:
| 地点 | 落点次数 | 获胜次数 | 胜率 |
|---|---|---|---|
| 农场群 | 91 | 4 | 4.4% |
| 军事基地 | 54 | 4 | 7.4% |
| 加油站 | 48 | 2 | 4.2% |
| 废品场 | 48 | 7 | 14.6% |
| 森林遗迹 | 30 | 3 | 10% |
| 信号塔 | 24 | 2 | 8.3% |
| 仓库 | 23 | 5 | 21.7% |
| 钓鱼码头 | 12 | 2 | 16.7% |
农场群是迄今为止最热门的落点,但胜率却最低。仓库的胜率最高,达到 21.7%。可能的原因与竞技《Apex英雄》玩家已经知道的情况相同。热门落点意味着早期战斗,而那些在开局交火中幸存下来的玩家会全副武装,并且需要应对的对手也更少。早期击杀 = 更好的装备 = 为比赛剩余阶段打下更好的基础。
毒圈是地图上最致命的武器
301 次淘汰中有 100 次(33%)是死于毒圈。每个模型都被告知了毒圈的存在,并且在每次缩圈前 20 回合收到提醒。然而,仍有三分之一的死亡源于毒圈。这本身就是一个故事,可能值得单独写一篇文章。
武器多样性
突击步枪占据了几乎所有模型的大部分击杀数。Grok 的击杀方式最多样化,它的几次胜利来自用车撞击,并且整个模拟中 10 次载具击杀大部分由 Grok 完成。GPT 5.4 在早期依赖手枪,并在中期用突击步枪进行清理。
最让我惊讶的是:我加入车辆是为了帮助模型在地图上移动。模型们很快发现,车辆作为武器比作为交通工具有用得多。它们在短短几局比赛内就学会了这一点。我不太清楚它们是如何做到的,而这正是让这个实验值得用更多随机种子再跑一次的原因。