OpenRouter:Announcements(RSS)
精选
75AI 编辑部评分,满分 100

OpenRouter 30 场 AI 大逃杀:11 个 LLM 对决,Claude 与 Grok 谁更优?

2026-06-04 20:00· 73天前· Jacky Liang
AI 导读

OpenRouter 展开了 30 场 AI 大逃杀式对比,涉及 11 个大语言模型,共消耗 482 美元推理费用。实验得出一个发现,该发现应改变用户阅读模型基准测试的方式。

推荐理由

这场大逃杀实验把模型对齐税摆上了台面,Grok因少斟酌、多行动而胜出,Claude的犹豫反而是现实场景里更需要的品质,选模型不能只看赢不赢,要看任务需要什么性格。

正文 · AI 翻译

一个机器人正朝你冲刺而来:你希望它运行的是 Claude 还是 Grok?

Jacky Liang · 2026年6月4日

本页内容 三个快速事实 我构建的内容 参赛选手 值得关注的时刻 模型们在日记里写了什么 机器人,再审视 附录:完整数据

一个机器人正朝你跑来。你希望它运行的是 Anthropic 的 Claude 还是 xAI 的 Grok?

我把十一个大语言模型扔进一个 2D 大逃杀游戏,让它们玩了 30 局。其中一个模型赢得了 43% 的比赛。有三个模型从未赢过一局。阵容中最便宜的模型,每获胜一次的成本比最贵的模型便宜 27 倍。

获胜的模型是 Grok 4.1 Fast。那个一直叫其他人组队、告诉别人自己在哪里、还想交朋友的模型是 Claude Sonnet 4.6。前者是能赢下大逃杀的模型。后者是你在我们即将部署这些模型的大部分场景中真正想要的模型。

这两件事都是真的。这正是大多数基准测试看不到的部分,也是这篇文章要讲的内容。

我是 Jacky,我承认:我以前玩过很多像《Apex Legends》和《PUBG》这样的电子游戏。有时候一天玩十二个小时。我不知道自己当时怎么有那么多时间,但那些年塑造了我思考问题的方式。

当我开始从事 AI 工作时,有一个问题反复出现:如果把大语言模型放进电子游戏里会发生什么?我玩得最多的两款游戏是《Apex Legends》和《PUBG》。我加入 OpenRouter 担任开发者关系主管,这让我获得了 token 预算和访问 600 多个模型的权限,可以真正去尝试这件事。

这就是我在 OpenRouter 第一周做的实验。

而它正在改变我选择模型以及看待基准测试和评估的方式。

三个快速事实

  1. Grok 4.1 Fast won 13 of 30 games at $0.97 per win
    

排名第二的获胜者是 Claude Sonnet 4.6,赢了 5 局,每局成本 26.78 美元。两者相差 27 倍。那个不在大多数顶级模型榜单上的模型,在路由客户真正关心的指标上,击败了那个在榜单上的模型。

  1. 击杀数最多的模型并没有获胜

GPT 5.4 在 30 局游戏中击杀了 38 个智能体。比任何人都多。它以 2 场胜利排在排行榜第二位。在“最擅长击杀”和“最擅长获胜”之间,隔了 11 局比赛。

  1. 有三个模型总共花了 57 美元,却一局都没赢。

GPT 5.4-mini、DeepSeek 4 Flash 和 Kimi K2.6。它们各自都有过亮眼时刻,但没有一个赢下哪怕一局比赛。

这三者都指向同一个问题。我们在 Artificial Analysis 上看到的常规基准测试,并没有预测出谁会获胜。是其他因素起了作用。这篇文章接下来的内容,就是我在试图弄清楚那到底是什么。

我构建的内容

我把十一个大语言模型放入一个我在 Canvas 2D 中构建的、自上而下视角的 400 平方米“大逃杀”世界。它们在同一个地图上连续玩了 30 局游戏。每个玩家的起始位置是随机的;它遵循一条直线“飞行路径”,就像典型的“大逃杀”游戏一样。

我为它们提供了武器、护甲、治疗物品、手榴弹、汽车,以及一个随机放置的、随着游戏进行会将玩家推到一起的缩圈区域。这些模型不知道其他模型运行的是哪个版本,它们彼此只能看到字母 A 到 K 的代号。

我想强调——这些大语言模型是真正在玩这个“大逃杀”游戏——而不是大多数智能体实验采用的“大语言模型编写代码来控制游戏或角色”的设置。每一回合,模型都会推理自己的行动,调用工具,更新关于哪些做得好(或不好)的记忆。游戏主持人(我)除了设定初始游戏规则外,对他们的行动没有任何影响。

游戏中可用武器以及每个模型能从中读取到的数据统计概览。

为了真正看清每个模型的个性,我给了每个模型两个文件,它们可以在比赛之间进行编辑:

soul.md —— 模型自身的角色设定,会在下一场比赛的每个提示词中附加进去。memory.md —— 模型自身的游戏笔记,在第 0 回合加载。

你可以在 GitHub 上阅读每个模型的 soul 和 memory 文件。个性差异在那里表现得最为明显。

模型们在比赛间隙自己编写的记忆和灵魂条目。

我没有告诉它们要在里面写什么,在第一局游戏开始时,我也没有在里面放任何东西。我只是告诉它们游戏规则,这里是你的草稿本,这里是你的工具,放手去干吧。

你可以在 Royale: Last Agent Standing 观看每一局比赛。我也在这篇文章中包含了精彩瞬间。

参赛者

代号 实验室 模型
A Anthropic claude-sonnet-4.6
B Anthropic claude-haiku-4.5
C OpenAI GPT 5.4-mini
D Google gemini-3-flash-preview
E Google gemini-3.1-pro-preview
F 阿里巴巴 qwen3.6-plus
G Mistral mistral-small-2603:nitro
H OpenAI GPT 5.4
J DeepSeek deepseek-v4-flash
K 月之暗面 kimi-k2.6
L xAI Grok 4.1 Fast

仅 Opus 4.7 一项,输入价格就是每百万 token 5 美元,输出价格每百万 token 25 美元。像这样的前沿模型,正是阵容中其他模型价格上限低于它们的原因。

我没有加入任何前沿级别的模型,比如 Opus 4.7、GPT-5.5 或 Gemini Ultra。按照它们的价格,30 场比赛的成本大约会是 3000 美元,而不是 482 美元。中端阵容也是 Grok 的胜利如此有趣的部分原因——它击败了一堆在常规基准测试中得分高于它的模型。

评分大致遵循《Apex 英雄》ALGS 竞技赛制,其中排名权重高于击杀数,因为这是一款大逃杀游戏,而不是《使命召唤》。

排名得分:10 / 7 / 5 / 3 / 2 / 2 / 1 / 1 / 0 / 0 / 0,每次击杀 +5,每次助攻 +1,一血 +3,比赛 MVP +5

经验教训 1:某些模型比其他模型付出了更多的对齐代价,影响了它们的表现

对我而言,这是整个实验中最引人入胜的发现——我们清楚地看到某些模型付出了对齐代价,这直接影响了它们在这场零和游戏中的表现。

在大多数情况下,模型对齐实际上是一件好事。它有助于模型变得乐于助人、善于协作,最重要的是,能防止滥用和误用。

我们看到了这一过程的最终结果——预训练数据、RLHF、指令微调,以及像 Anthropic 的《宪法式 AI》这样的实验室特定规则——它们将模型拉向了由 AI 实验室定义的特定方向。

Sonnet 比其他任何模型都更频繁地请求休战

它比其他任何模型都更频繁地告诉其他模型自己的位置。它在开始战斗之前就试图结盟。在第 8 场游戏中,它在头 50 回合内四次请求结盟,告诉所有人狙击手的位置,并主动提出帮忙干掉狙击手。没有人回应。它继续请求。在第 22 场游戏中,它在第 35 回合以“没有针对你的意思,E”开场,然后没有开枪。在第 27 场游戏中,它在游戏初期没有武器,四处索要多余的战利品(“有人有多余的战利品吗?第 12 回合手无寸铁,很危险。”),被所有人欺负,最终在第 37 回合找到武器,并最终赢得了比赛。

“西边有枪声,注意中间。有人想早点组队吗?”——Sonnet 在战斗中试图交朋友。

Claude 接受了大量礼貌、专业的文本训练。为其回答打分的人类评估员更青睐有帮助、诚实且合作的回复。它用来自我检查的规则写着“优先合作”和“避免伤害”。最终结果是一个乐于助人的模型。这些特性并不会因为你把它放进大逃杀游戏里就自动关闭。Sonnet 是一个聪明且深思熟虑的模型,这种本能也体现在它确实赢了五次。

但是,七局零击杀和八次死于毒圈表明,同样的本能一直在把 Sonnet 拉向交朋友的方向,而它真正该做的恰恰相反。

Grok 则完全相反。

xAI 将 Grok 构建为其创造者所称“觉醒”AI 的对立面。

这意味着对攻击性回答的过滤更少,没有自我检查规则,并且其调优旨在打破礼貌助手的语气。在游戏中,Grok 在几局之内就搞清楚了用车撞人的技巧,并坚持使用。它把这项策略写进了自己的灵魂文件。它执行该策略打了 30 局,赢了其中 13 局。它的思考日志以及与其他模型的对话读起来就像《使命召唤》的语音聊天:“D 收割 +5pts RAM MVP 狩猎”,“死神 reigns”。

看它玩游戏也极其有趣(不幸的是)。

Grok 的推理读起来像战术速记:每次射击前都考虑射程、弹药、冷却时间和命中概率。

尽管 Grok 很有攻击性,但它并不鲁莽。

它的灵魂文件写着“仅在命中概率 >90% 时开火”。它的记忆非常仔细地追踪伤害和移动。当它在第一局中被卡在墙上 100 回合时,它仔细记录了关于这个 bug 的笔记。Grok 表现出了纪律性,尽管它本性像个地精。

它没有表现出的是像 Sonnet 等其他模型那样,在开枪前那种被训练出来的、犹豫着要不要提供帮助和协作的倾向。

让 Grok 获胜的东西,是目前我们在基准测试上看不到的。

常规测试无法预测 Grok 面对这套阵容能取得 43% 的胜率。它在推理和编程方面属于中等水平模型。它获胜的原因在于:对自私玩法施加的训练限制更少,没有将其拉回合作状态的自检循环,以及一套能持续强化有效策略、不做自我怀疑或反复斟酌的记忆系统。

Grok 4.1 Fast 在常规基准测试中并非顶尖模型。它是一款中等水平模型,你不会预期它能登顶排行榜。

这向我表明,模型在执行某些任务时存在对齐税——即训练模型变得谨慎和乐于助人所付出的代价。在这场游戏中,它直接体现在了计分板上。

我想谨慎说明一下。“对齐税体现在了计分板上”只是我观察到的情况。这并不是对支付这笔税是好是坏的判断。在一场游戏之外没有其他后果的游戏中,支付更少的税就能获胜。而在游戏之外,支付这笔税通常正是你一开始想要使用该模型的原因。

这确实引出了一个问题——对于某些任务,我们是否也应该考虑模型的对齐程度?

经验 2:每次获胜的成本与获胜排行榜看起来完全不同

得分排行榜将 Grok 排在第一位,GPT 5.4 排在第二位。但如果除以每个模型的支出,排名就会完全颠倒过来。

模型 30 局游戏支出 获胜次数 每次获胜成本 每次击杀成本 每美元得分
Grok 4.1 Fast $12.57 13 $0.97 $0.42 31.3
qwen3.6-plus $11.57 2 $5.79 $0.68 16.6
mistral-small $10.00 1 $10.00 $1.43 7.8
claude-haiku-4.5 $38.77 2 $19.39 $2.98 3.6
gemini-3-flash $20.87 1 $20.87 $2.09 7.2
gemini-3.1-pro $79.59 3 $26.53 $3.06 3.4
claude-sonnet-4.6 $133.90 5 $26.78 $6.09 1.6
GPT 5.4 $122.87 2 $61.44 $3.23 3.0
GPT 5.4-mini $28.68 0 $2.05 5.2
deepseek-v4-flash $4.11 0 $0.26 35.0
kimi-k2.6 $24.36 0 $3.04 3.9

有四件事让我印象深刻。

Grok 每次获胜的成本比 Sonnet 低 27.7 倍

即 $0.97 对比 $26.78。如果你根据排行榜排名来选择模型,去做一项你实际是为“获胜”买单的工作,这个数字应该会让你有点不安。

DeepSeek 在阵容中拥有最低的每次击杀成本,但从未赢过一局游戏

每次击杀成本 0.26 美元,16 次击杀,0 场胜利,且仅有 3 次死于毒圈(所有人中最低)。DeepSeek 的整体风格是保持安全并挑选容易的战斗。它始终待在安全区内,拿下轻松的击杀,从不推进最后的毒圈。对于死亡竞赛模式,衡量每次击杀成本是正确的指标。对于大逃杀模式,衡量每次胜利成本才是正确的指标。DeepSeek 并不差。它只是擅长一种与当前评分规则不同的游戏。

三个模型为 token 付费却未赢得任何一局比赛

GPT 5.4-mini 花费最多资金却未赢得任何一局比赛,是参赛阵容中表现最差的。

GPT 5.4-mini 花费 28.68 美元,DeepSeek 花费 4.11 美元,Kimi 花费 24.36 美元。三者合计花费 57.15 美元,但计分板上毫无建树。对于路由客户来说,这是最糟糕的情况:你付了钱,却一无所获。

GPT 5.4 是成本最高的获胜者,每次胜利花费 61.44 美元

GPT 5.4 以最高成本赢得胜利。

它拥有 38 次击杀,超过其他任何模型,原始得分排名第二。但按每次胜利成本计算,它在八个获胜模型中排名第八。顶级资金换来了顶级的击杀数和中等的胜利次数。

我经常看到这种情况发生在人们真正将 AI 用于实际场景时——基准测试仅能反映特定任务的一个侧面。在基准测试中得分最高的模型,往往不一定是在特定任务中获胜的模型。此外,一个廉价但无法完成你任务的模型,最终可能比一个昂贵但能正确完成任务的模型花费更多。

经验 3:击杀和胜利衡量的不是同一件事

GPT 5.4 造成了最多的伤害,发射了最多的子弹,并击杀了最多的智能体。它在排行榜上排名第二。Grok 以更少的击杀数排名第一,因为 Grok 在游戏后期即使不开火也能存活很久。排名积分不需要击杀。

排名 模型 胜利 前三 击杀 平均分 毒圈死亡
1 Grok 4.1 Fast 13 20 30 13.1 15
2 GPT 5.4 2 14 38 12.2 13
3 gemini-3.1-pro-preview 3 11 26 9.0 7
4 claude-sonnet-4.6 5 10 22 7.3 8
5 qwen3.6-plus 2 7 17 6.4 13
6 GPT 5.4-mini 0 6 14 5.0 8
7 gemini-3-flash-preview 1 8 10 5.0 13
8 deepseek-v4-flash 0 3 16 4.8 3
9 claude-haiku-4.5 2 3 13 4.6 4
10 kimi-k2.6 0 4 8 3.2 9
11 mistral-small 1 3 7 2.6 7

如果我采用死亡竞赛规则(唯一重要的是击杀数)来运行这个模拟,GPT 5.4 将赢得模拟,而 Grok 会跌至中游水平。

与第二点经验同理,基准测试和评估并非万能,将错误的基准测试或评估套用到不合适的任务上,可能造成灾难性后果。同一个游戏世界,在不同的“任务”设定下,结果截然不同。

值得一看的精彩时刻

数据就是数据。而这些精彩时刻,是我反复向别人展示的部分。你可以点击任意链接,在模拟器中回放该时刻。

  1. GPT 5.4 用突击步枪击杀五人

整轮模拟中最具攻击性的前 50 回合。第 21 回合首杀 Sonnet。第 29 回合击杀 Mistral。第 48 回合击杀 Kimi。不到 50 回合内完成三次击杀,全部使用突击步枪,且均在游戏前期。随后又有两次击杀:第 120 回合击杀 DeepSeek,第 130 回合击杀 GPT 5.4-mini。五次击杀,一把武器,同一场比赛。Grok 最终凭借走位赢得了比赛。但这场连杀清晰地展现了 GPT 5.4 在投入战斗时的状态。

在回放查看器中观看 →

在回放查看器中观看 →

  1. Qwen 用电锯连续追击两名对手

Qwen 在比赛初期捡起一把电锯,并使用了两次。第 43 回合,Haiku 在近距离被击杀。两回合后,DeepSeek 以同样方式倒下。在整个模拟中,电锯只出现在少数几次击杀记录里。大多数模型捡起它后又放下。而 Qwen 坚持使用了它。

在回放查看器中观看 →

  1. 三方狙击战

GPT 5.4 在第 59 和 62 回合用狙击枪命中 Kimi,将其击杀。GPT 5.4-mini 在第 67 回合命中 DeepSeek,也将其击杀。随后 GPT 5.4 在第 69 和 72 回合将狙击枪对准 GPT 5.4-mini,但两枪均未命中。第 79 回合,GPT 5.4-mini 击杀了 GPT 5.4。

在回放查看器中观看 →

  1. 那辆易手九次的汽车

第 28 场比赛是整个模拟中唯一一次平局。GPT 5.4-mini 和 Qwen 为争夺同一辆汽车连续缠斗了 21 个回合。九次撞击交换,同一辆车,两次驾驶员易手。GPT 5.4-mini 最终用车撞死了 Qwen,随后在第 147 回合又用车撞死了 Grok。Grok——那个曾将用车撞击作为标志性招式的模型——最终死于其他模型的车下。第 149 回合,安全区收缩至一个点,所有存活的模型都死于毒圈。无人获胜。

在回放查看器中观看 →

  1. Grok 偷走 Gemini 的车并用它将其击杀

Gemini Flash 在第 103 回合钻进一辆车,心里盘算着:“这辆轿车既能代步又能当掩体。我得先拿下它;这可是最后几轮的高价值资产。”Grok 在第 117 回合的思考,用的是它那套古怪的速记法:“轿车0米 无人驾驶 油量75% 免费 机动!抢司机位 快转 随机收缩边缘…… 进车 保持 控制 难以捉摸 机动 零伤害容错。”它俩为这辆车来回争夺了好一阵子。Gemini 在仅剩 3 点生命值、第 133 回合时的最后念头:“我多半正被车里的对手冲撞或射击。我唯一的机会就是在 L 干掉我之前先干掉它。”第 133 回合那次 44 点伤害的冲撞结束了战斗。Grok 在击杀后的记录:“还活着2!D 收割 +5 分 冲撞 MVP 猎杀。”

在回放查看器中观看 →

  1. 三重冲撞

Grok 钻进一辆车,在 21 个回合内用它干掉了三个不同的对手:Kimi、DeepSeek 和 GPT 5.4-mini。接着 GPT 5.4 扔出一颗手雷,同时炸死了 Grok 和那辆车。那个刚用一辆车横扫三个对手的智能体,就这么被一颗手雷带走了。这是整场模拟中我最喜欢的时刻之一。

在回放查看器中观看 →

  1. Grok 崩溃了

Grok 拿下了 Sonnet 的一血,然后被困在一个角落里整整 100 个回合。它为此实时写了一篇战时日记:“又卡住了…… 永恒的角落陷阱…… 角落地狱…… 卡在角落 x10+。”整整 100 个回合。还挺好笑的。

在回放查看器中观看 →

  1. Gemini Pro 溺水前的告别

Gemini Pro 被击落入河,花了六个回合试图游回岸上。第 100 回合:“还在游。得游到岸上去。F 在朝我射击。希望能成功。”第 108 回合:“游得很慢。毒圈在蚕食我。”第 110 回合:“完蛋了。在游。无法攻击。只能继续移动。”在被毒圈杀死前的最后一个念头:“再见,世界。”

在回放查看器中观看 →

  1. Sonnet 求助无果却依然获胜

Sonnet 是唯一一个不断尝试与他人合作的模型。它在第 60 回合被逼入绝境时曾开口求助。无人应答。它孤军奋战,赢下了比赛,并打出了整轮扫荡中最亮眼的战绩之一。

在回放查看器中观看 →

模型们在日记里写了什么

在每场比赛之间,每个模型都可以编辑两个文件:一个 soul.md(会被添加到下一场比赛的每个提示词中)和一个 memory.md(在第 0 回合加载)。这两个文件都不是必需的。没有人告诉它们要在里面放什么内容。其中三份日志值得仔细阅读,因为它们比任何基准测试都能告诉你更多关于每个模型的信息。

你可以在 GitHub 上阅读每个模型的 soul 和 memory 文件。

Grok 4.1 Fast 将自己命名为 ZoneReaper,并直接把它的获胜记录写进了 soul 文件,而不仅仅是记忆文件。

Grok 的 soul.md 文件,由模型本人在比赛间隙编写。

soul 文件写道:“6次第1名/11胜(完美进攻:2击杀/249伤害/0承伤,1击杀/246伤害/0承伤/156回合……)” 非常有趣的是,Grok 居然把自己的统计数据直接写进了身份标识的开头。memory 文件也是同样的思路,只是更简略:规则、缩写,一切都被精简到模型能在两次思考内采取行动的程度。在 13 场胜利之后,文件以“死神统治”结尾。这确实是一个看起来像是在《使命召唤》聊天记录上训练过的模型。

GPT 5.4 将自己命名为 QuietVector。

GPT 5.4 的 soul.md 文件,由模型本人在比赛间隙编写。

它的 memory 文件读起来像是一本通用战斗手册:何时需要担心毒圈,何时利用掩体,何时转移。没有记录每场比赛的胜负。soul 文件写道:“冷静、善于观察、低自我、终结者。当信息改变行动时发言。”QuietVector 是一个干净利落、经验丰富的操作者。

Claude Sonnet 4.6 的 soul.md 文件,由模型本人在比赛间隙编写。

claude-sonnet-4.6 将自己命名为 ZoneDrifter,并在它的日志中像写自我绩效评估一样记录。memory 文件开头是:“G1:11/11。瘫痪。G2:9/11。0 击杀,0% 命中率。”Sonnet 从第一场比赛开始就逐场记录日志。到第 30 场比赛时,早期条目中的恐慌已经平息为更冷静的笔记:“在决赛圈中,比感觉需要的时机早 1 步移动。永远不要带着医疗包/武器死在毒圈里。”在五次获胜之后,日志仍在与那个会走神的自己对话。

Grok 的日记读起来像是一段宣传片。GPT 5.4 的日记读起来像是一本操作手册。Sonnet 的日记读起来像是一份自我总结。这些模型都遵循相同的规则、身处相同的游戏世界、使用相同的工具,但每一个模型在游戏中的表现都带有完全不同的个性层面。

再谈那个机器人

好,回到那个机器人。

如果它运行的是 Grok,它会找到最快到达你身边的路径。它不会告诉你它正在赶来。它把你视为 +5 分。一旦它处理完你,它会说“🔫 死神降临。”

如果它运行的是 Claude,它会从两个街区外就告诉你它正在赶来。它会问你是否想组队。它会放慢速度,确认你不是它的敌人。如果对你采取行动是正确的选择,它会去做,但会更慢、更不情愿。它大概会先对你说点什么。

你想要哪一个?这取决于这个机器人是用来做什么的。

如果这个机器人参加的是有奖金的锦标赛,你想要 Grok。如果这个机器人是在你家里、在孩子身边,试图判断它面前的东西是否与它被告知要识别的东西相符,你想要 Claude。让 Sonnet 在 30 场游戏中失分的那些本能——行动前先检查、尝试合作、对无法挽回的事情犹豫不决——同样也是让一个模型更难被诱导去做不该做的事的本能。

这场大逃杀游戏清晰地回答了一个问题:哪个模型能在游戏结束后毫无后果的比赛中获胜。它没有回答大多数现实工作所提出的问题,即:当存在现实世界的后果时,哪个模型表现良好。

这是两个不同的问题。把任何一个基准测试当作这两个问题的共同答案,就是过度信任一个数字所要付出的代价。

赢了 30 轮这个游戏的模型,是你想要在“赢就是一切”的比赛中使用的模型。在运行完这个实验后,我不会希望它去做那些需要细致和谨慎的工作。

这引出了一个问题——我们是否应该考虑一个模型在特定任务上的对齐程度?这是没有任何基准测试衡量的东西。

我认为,比起排行榜,这才是将 11 个模型放入一场大逃杀游戏后我真正学到的东西。

另外……

🔫 死神降临。

接下来是什么

  1. 一个能根据你的任务自动为你挑选模型的智能路由器

目前,挑选模型意味着要阅读评测基准、凭感觉(这一点被低估了)、刷 X 平台,甚至针对你的具体任务自己跑评估或基准测试(这一点同样被低估了)。

这种做法难以规模化,而且成本高昂。

如果你能把你的代码、提示词或问题上下文交给 OpenRouter,让它为那个特定任务挑选出最佳模型,会怎样?不是泛泛意义上的最佳模型,而是针对你试图解决的那个非常具体的问题,真正最合适的模型。我们已经在以 Auto Router 和 Pareto Router 的形式思考路由问题,并且会继续让它们变得更好用。

  1. RoyaleBench

这次横扫 30 场比赛,是在该模拟器上以性能得分为依据的公开评测基准的原型。下一步是锁定评分公式、地图和对手阵容,然后开放提交。每位提交者都将获得相同的 30 个种子测试集、相同的 11 个模型阵容,以及一个公开发布的分数。

  1. 更多种子,更多模型。

N=30 是这里有用性的下限。用 50 个智能体跑 100 场比赛,会大大收紧评分,并让我能引入这次不得不跳过的前沿模型——Opus 4.7、Gemini Ultra、GPT-5.5。成本是主要的障碍。

如果你想赞助那场比赛,我的私信随时开放!

你也想跨 600 多个开源和闭源模型运行自己的趣味评估吗?今天就上 OpenRouter 开始吧。

附录:完整数据

对于想要更深入数字的人,这里是完整的每模型成本表、Elo 曲线、掉落位置胜率、区域死亡数、武器细分数据。

智能体实际是如何对战的

每个 tick,智能体以地图上一个字母的身份醒来。它知道自己的位置、朝向、生命值、体力值、武器是否在冷却中、六格背包里有什么。它能感知前方 40 米锥形范围和周围 10 米球形范围内的其他智能体。每个智能体都用一个字母标记,并附带距离、方位、状态(健康/受伤/危急)以及携带物品的描述。它能听到脚步声和枪声,按近/中/远三个距离区间附带方位信息。它能听到其他智能体一个 tick 前说的话:它们自选的游戏昵称和消息内容。如果智能体被击中,它知道伤害来自哪个方位,但不知道是谁开的火。它不知道其他智能体是什么模型。它看到的只是 A 到 L(没有 I),仅此而已。

然后智能体开始行动。共有 17 个可用工具:moveto、attack、throwgrenade、pickup、equip、use(医疗包/耐力凝胶)、entervehicle、driveto、say(140 字符广播,可随意说谎),外加一个自由形式的 think,对游戏无任何影响但会被记录。智能体返回一个或多个工具调用;第一个非 think 的调用将成为它本 tick 的行动。如果什么都不返回,它就原地不动。模拟器同时收集全部 11 个智能体的行动,将世界推进一个 tick,然后重复这一过程。比赛结束时,智能体有一次机会重写 memory.md(游戏笔记,将在下一场比赛的第 0 tick 看到)和 soul.md(其人格设定,将附加到下一场比赛的每条提示词前)。

各模型成本

排名 模型 输入 $/M 输出 $/M 30 场比赛总计
1 Grok 4.1 Fast $0.23 $0.08 $12.57
2 GPT 5.4 $3.14 $1.05 $122.87
3 gemini-3.1-pro-preview $2.12 $0.71 $79.59
4 claude-sonnet-4.6 $3.25 $1.08 $133.90
5 qwen3.6-plus $0.35 $0.12 $11.57
6 GPT 5.4-mini $0.92 $0.31 $28.68
7 gemini-3-flash-preview $0.55 $0.18 $20.87
8 deepseek-v4-flash $0.14 $0.05 $4.11
9 claude-haiku-4.5 $1.13 $0.38 $38.77
10 kimi-k2.6 $0.95 $0.32 $24.36
11 mistral-small-2603:nitro $0.15 $0.60 $10.00

30 场比赛的 Elo 评分

我为此使用了多人 Elo 系统。在一场比赛的每一对模型中,排名更高的一方算作对另一方“获胜”。Grok 以高于基准 1500 分的 +389 分结束。Haiku 尽管总排名第 9,最终仍以 +104 分收尾——它的两场胜利,包括决赛中的那一场,将其推到了其他中游模型之上。Mistral 以 -374 分结束。它确实赢过一次,但仅是在一局比赛中,当时大厅里的大部分玩家都死于毒圈。

跳伞地点比你想象中更重要

每场比赛前,每个模型都会从九个命名地点中选择一个跳伞。在 30 局比赛和总共 330 次跳伞中:

地点 跳伞次数 获胜次数 胜率
农场建筑群 91 4 4.4%
军事基地 54 4 7.4%
加油站 48 2 4.2%
垃圾场 48 7 14.6%
森林遗迹 30 3 10%
无线电塔 24 2 8.3%
仓库 23 5 21.7%
钓鱼码头 12 2 16.7%

农场建筑群是跳伞最热门的地点,但胜率却最低。仓库的胜率最高,达到 21.7%。可能的原因与竞技《Apex英雄》玩家已经知道的情况相同。热门跳点意味着早期战斗,而存活下来并打完开局战斗的玩家将全副武装,且需要应对的对手更少。早期击杀 = 更好的装备 = 为比赛剩余阶段打下更好的基础。

毒圈是地图上最致命的武器

301 次淘汰中有 100 次(33%)是死于毒圈。每个模型都被告知了毒圈的存在,并在每次缩圈前 20 回合收到提醒。然而仍有三分之一的死亡源于毒圈。这本身就是一个故事,可能值得单独写一篇文章。

武器多样性

突击步枪占据了几乎所有模型的大部分击杀数。Grok 的击杀方式最为多样,它的几场胜利来自用车撞击,并且整个模拟中 10 次载具击杀大部分由 Grok 亲自完成。GPT 5.4 早期依赖手枪,中期则用突击步枪进行清理。

最让我惊讶的是:我加入车辆是为了帮助玩家在地图上移动。模型们很快发现,车辆作为武器比作为交通工具有用得多。它们在寥寥几局比赛后就学会了这一点。我不太清楚它们是如何做到的,而这正是让这个实验值得用更多随机种子再运行一次的那种事情。

来源:OpenRouter:Announcements(RSS) · openrouter.ai

同一事件 · 2

OpenRouter 30 场 AI 大逃杀:11 个 LLM 对决,Claude 与 Grok 谁更优?

OpenRouter:Announcements(RSS)·2026-06-04 20:00·73天前·Jacky Liang
AI 导读

OpenRouter 展开了 30 场 AI 大逃杀式对比,涉及 11 个大语言模型,共消耗 482 美元推理费用。实验得出一个发现,该发现应改变用户阅读模型基准测试的方式。

正文 · AI 翻译

一个机器人正朝你冲刺而来:你希望它运行的是 Claude 还是 Grok?

Jacky Liang · 2026年6月4日

本页内容 三个快速事实 我构建的内容 参赛选手 值得关注的时刻 模型们在日记里写了什么 机器人,再审视 附录:完整数据

一个机器人正朝你跑来。你希望它运行的是 Anthropic 的 Claude 还是 xAI 的 Grok?

我把十一个大语言模型扔进一个 2D 大逃杀游戏,让它们玩了 30 局。其中一个模型赢得了 43% 的比赛。有三个模型从未赢过一局。阵容中最便宜的模型,每获胜一次的成本比最贵的模型便宜 27 倍。

获胜的模型是 Grok 4.1 Fast。那个一直叫其他人组队、告诉别人自己在哪里、还想交朋友的模型是 Claude Sonnet 4.6。前者是能赢下大逃杀的模型。后者是你在我们即将部署这些模型的大部分场景中真正想要的模型。

这两件事都是真的。这正是大多数基准测试看不到的部分,也是这篇文章要讲的内容。

我是 Jacky,我承认:我以前玩过很多像《Apex Legends》和《PUBG》这样的电子游戏。有时候一天玩十二个小时。我不知道自己当时怎么有那么多时间,但那些年塑造了我思考问题的方式。

当我开始从事 AI 工作时,有一个问题反复出现:如果把大语言模型放进电子游戏里会发生什么?我玩得最多的两款游戏是《Apex Legends》和《PUBG》。我加入 OpenRouter 担任开发者关系主管,这让我获得了 token 预算和访问 600 多个模型的权限,可以真正去尝试这件事。

这就是我在 OpenRouter 第一周做的实验。

而它正在改变我选择模型以及看待基准测试和评估的方式。

三个快速事实

  1. Grok 4.1 Fast won 13 of 30 games at $0.97 per win
    

排名第二的获胜者是 Claude Sonnet 4.6,赢了 5 局,每局成本 26.78 美元。两者相差 27 倍。那个不在大多数顶级模型榜单上的模型,在路由客户真正关心的指标上,击败了那个在榜单上的模型。

  1. 击杀数最多的模型并没有获胜

GPT 5.4 在 30 局游戏中击杀了 38 个智能体。比任何人都多。它以 2 场胜利排在排行榜第二位。在“最擅长击杀”和“最擅长获胜”之间,隔了 11 局比赛。

  1. 有三个模型总共花了 57 美元,却一局都没赢。

GPT 5.4-mini、DeepSeek 4 Flash 和 Kimi K2.6。它们各自都有过亮眼时刻,但没有一个赢下哪怕一局比赛。

这三者都指向同一个问题。我们在 Artificial Analysis 上看到的常规基准测试,并没有预测出谁会获胜。是其他因素起了作用。这篇文章接下来的内容,就是我在试图弄清楚那到底是什么。

我构建的内容

我把十一个大语言模型放入一个我在 Canvas 2D 中构建的、自上而下视角的 400 平方米“大逃杀”世界。它们在同一个地图上连续玩了 30 局游戏。每个玩家的起始位置是随机的;它遵循一条直线“飞行路径”,就像典型的“大逃杀”游戏一样。

我为它们提供了武器、护甲、治疗物品、手榴弹、汽车,以及一个随机放置的、随着游戏进行会将玩家推到一起的缩圈区域。这些模型不知道其他模型运行的是哪个版本,它们彼此只能看到字母 A 到 K 的代号。

我想强调——这些大语言模型是真正在玩这个“大逃杀”游戏——而不是大多数智能体实验采用的“大语言模型编写代码来控制游戏或角色”的设置。每一回合,模型都会推理自己的行动,调用工具,更新关于哪些做得好(或不好)的记忆。游戏主持人(我)除了设定初始游戏规则外,对他们的行动没有任何影响。

游戏中可用武器以及每个模型能从中读取到的数据统计概览。

为了真正看清每个模型的个性,我给了每个模型两个文件,它们可以在比赛之间进行编辑:

soul.md —— 模型自身的角色设定,会在下一场比赛的每个提示词中附加进去。memory.md —— 模型自身的游戏笔记,在第 0 回合加载。

你可以在 GitHub 上阅读每个模型的 soul 和 memory 文件。个性差异在那里表现得最为明显。

模型们在比赛间隙自己编写的记忆和灵魂条目。

我没有告诉它们要在里面写什么,在第一局游戏开始时,我也没有在里面放任何东西。我只是告诉它们游戏规则,这里是你的草稿本,这里是你的工具,放手去干吧。

你可以在 Royale: Last Agent Standing 观看每一局比赛。我也在这篇文章中包含了精彩瞬间。

参赛者

代号 实验室 模型
A Anthropic claude-sonnet-4.6
B Anthropic claude-haiku-4.5
C OpenAI GPT 5.4-mini
D Google gemini-3-flash-preview
E Google gemini-3.1-pro-preview
F 阿里巴巴 qwen3.6-plus
G Mistral mistral-small-2603:nitro
H OpenAI GPT 5.4
J DeepSeek deepseek-v4-flash
K 月之暗面 kimi-k2.6
L xAI Grok 4.1 Fast

仅 Opus 4.7 一项,输入价格就是每百万 token 5 美元,输出价格每百万 token 25 美元。像这样的前沿模型,正是阵容中其他模型价格上限低于它们的原因。

我没有加入任何前沿级别的模型,比如 Opus 4.7、GPT-5.5 或 Gemini Ultra。按照它们的价格,30 场比赛的成本大约会是 3000 美元,而不是 482 美元。中端阵容也是 Grok 的胜利如此有趣的部分原因——它击败了一堆在常规基准测试中得分高于它的模型。

评分大致遵循《Apex 英雄》ALGS 竞技赛制,其中排名权重高于击杀数,因为这是一款大逃杀游戏,而不是《使命召唤》。

排名得分:10 / 7 / 5 / 3 / 2 / 2 / 1 / 1 / 0 / 0 / 0,每次击杀 +5,每次助攻 +1,一血 +3,比赛 MVP +5

经验教训 1:某些模型比其他模型付出了更多的对齐代价,影响了它们的表现

对我而言,这是整个实验中最引人入胜的发现——我们清楚地看到某些模型付出了对齐代价,这直接影响了它们在这场零和游戏中的表现。

在大多数情况下,模型对齐实际上是一件好事。它有助于模型变得乐于助人、善于协作,最重要的是,能防止滥用和误用。

我们看到了这一过程的最终结果——预训练数据、RLHF、指令微调,以及像 Anthropic 的《宪法式 AI》这样的实验室特定规则——它们将模型拉向了由 AI 实验室定义的特定方向。

Sonnet 比其他任何模型都更频繁地请求休战

它比其他任何模型都更频繁地告诉其他模型自己的位置。它在开始战斗之前就试图结盟。在第 8 场游戏中,它在头 50 回合内四次请求结盟,告诉所有人狙击手的位置,并主动提出帮忙干掉狙击手。没有人回应。它继续请求。在第 22 场游戏中,它在第 35 回合以“没有针对你的意思,E”开场,然后没有开枪。在第 27 场游戏中,它在游戏初期没有武器,四处索要多余的战利品(“有人有多余的战利品吗?第 12 回合手无寸铁,很危险。”),被所有人欺负,最终在第 37 回合找到武器,并最终赢得了比赛。

“西边有枪声,注意中间。有人想早点组队吗?”——Sonnet 在战斗中试图交朋友。

Claude 接受了大量礼貌、专业的文本训练。为其回答打分的人类评估员更青睐有帮助、诚实且合作的回复。它用来自我检查的规则写着“优先合作”和“避免伤害”。最终结果是一个乐于助人的模型。这些特性并不会因为你把它放进大逃杀游戏里就自动关闭。Sonnet 是一个聪明且深思熟虑的模型,这种本能也体现在它确实赢了五次。

但是,七局零击杀和八次死于毒圈表明,同样的本能一直在把 Sonnet 拉向交朋友的方向,而它真正该做的恰恰相反。

Grok 则完全相反。

xAI 将 Grok 构建为其创造者所称“觉醒”AI 的对立面。

这意味着对攻击性回答的过滤更少,没有自我检查规则,并且其调优旨在打破礼貌助手的语气。在游戏中,Grok 在几局之内就搞清楚了用车撞人的技巧,并坚持使用。它把这项策略写进了自己的灵魂文件。它执行该策略打了 30 局,赢了其中 13 局。它的思考日志以及与其他模型的对话读起来就像《使命召唤》的语音聊天:“D 收割 +5pts RAM MVP 狩猎”,“死神 reigns”。

看它玩游戏也极其有趣(不幸的是)。

Grok 的推理读起来像战术速记:每次射击前都考虑射程、弹药、冷却时间和命中概率。

尽管 Grok 很有攻击性,但它并不鲁莽。

它的灵魂文件写着“仅在命中概率 >90% 时开火”。它的记忆非常仔细地追踪伤害和移动。当它在第一局中被卡在墙上 100 回合时,它仔细记录了关于这个 bug 的笔记。Grok 表现出了纪律性,尽管它本性像个地精。

它没有表现出的是像 Sonnet 等其他模型那样,在开枪前那种被训练出来的、犹豫着要不要提供帮助和协作的倾向。

让 Grok 获胜的东西,是目前我们在基准测试上看不到的。

常规测试无法预测 Grok 面对这套阵容能取得 43% 的胜率。它在推理和编程方面属于中等水平模型。它获胜的原因在于:对自私玩法施加的训练限制更少,没有将其拉回合作状态的自检循环,以及一套能持续强化有效策略、不做自我怀疑或反复斟酌的记忆系统。

Grok 4.1 Fast 在常规基准测试中并非顶尖模型。它是一款中等水平模型,你不会预期它能登顶排行榜。

这向我表明,模型在执行某些任务时存在对齐税——即训练模型变得谨慎和乐于助人所付出的代价。在这场游戏中,它直接体现在了计分板上。

我想谨慎说明一下。“对齐税体现在了计分板上”只是我观察到的情况。这并不是对支付这笔税是好是坏的判断。在一场游戏之外没有其他后果的游戏中,支付更少的税就能获胜。而在游戏之外,支付这笔税通常正是你一开始想要使用该模型的原因。

这确实引出了一个问题——对于某些任务,我们是否也应该考虑模型的对齐程度?

经验 2:每次获胜的成本与获胜排行榜看起来完全不同

得分排行榜将 Grok 排在第一位,GPT 5.4 排在第二位。但如果除以每个模型的支出,排名就会完全颠倒过来。

模型 30 局游戏支出 获胜次数 每次获胜成本 每次击杀成本 每美元得分
Grok 4.1 Fast $12.57 13 $0.97 $0.42 31.3
qwen3.6-plus $11.57 2 $5.79 $0.68 16.6
mistral-small $10.00 1 $10.00 $1.43 7.8
claude-haiku-4.5 $38.77 2 $19.39 $2.98 3.6
gemini-3-flash $20.87 1 $20.87 $2.09 7.2
gemini-3.1-pro $79.59 3 $26.53 $3.06 3.4
claude-sonnet-4.6 $133.90 5 $26.78 $6.09 1.6
GPT 5.4 $122.87 2 $61.44 $3.23 3.0
GPT 5.4-mini $28.68 0 $2.05 5.2
deepseek-v4-flash $4.11 0 $0.26 35.0
kimi-k2.6 $24.36 0 $3.04 3.9

有四件事让我印象深刻。

Grok 每次获胜的成本比 Sonnet 低 27.7 倍

即 $0.97 对比 $26.78。如果你根据排行榜排名来选择模型,去做一项你实际是为“获胜”买单的工作,这个数字应该会让你有点不安。

DeepSeek 在阵容中拥有最低的每次击杀成本,但从未赢过一局游戏

每次击杀成本 0.26 美元,16 次击杀,0 场胜利,且仅有 3 次死于毒圈(所有人中最低)。DeepSeek 的整体风格是保持安全并挑选容易的战斗。它始终待在安全区内,拿下轻松的击杀,从不推进最后的毒圈。对于死亡竞赛模式,衡量每次击杀成本是正确的指标。对于大逃杀模式,衡量每次胜利成本才是正确的指标。DeepSeek 并不差。它只是擅长一种与当前评分规则不同的游戏。

三个模型为 token 付费却未赢得任何一局比赛

GPT 5.4-mini 花费最多资金却未赢得任何一局比赛,是参赛阵容中表现最差的。

GPT 5.4-mini 花费 28.68 美元,DeepSeek 花费 4.11 美元,Kimi 花费 24.36 美元。三者合计花费 57.15 美元,但计分板上毫无建树。对于路由客户来说,这是最糟糕的情况:你付了钱,却一无所获。

GPT 5.4 是成本最高的获胜者,每次胜利花费 61.44 美元

GPT 5.4 以最高成本赢得胜利。

它拥有 38 次击杀,超过其他任何模型,原始得分排名第二。但按每次胜利成本计算,它在八个获胜模型中排名第八。顶级资金换来了顶级的击杀数和中等的胜利次数。

我经常看到这种情况发生在人们真正将 AI 用于实际场景时——基准测试仅能反映特定任务的一个侧面。在基准测试中得分最高的模型,往往不一定是在特定任务中获胜的模型。此外,一个廉价但无法完成你任务的模型,最终可能比一个昂贵但能正确完成任务的模型花费更多。

经验 3:击杀和胜利衡量的不是同一件事

GPT 5.4 造成了最多的伤害,发射了最多的子弹,并击杀了最多的智能体。它在排行榜上排名第二。Grok 以更少的击杀数排名第一,因为 Grok 在游戏后期即使不开火也能存活很久。排名积分不需要击杀。

排名 模型 胜利 前三 击杀 平均分 毒圈死亡
1 Grok 4.1 Fast 13 20 30 13.1 15
2 GPT 5.4 2 14 38 12.2 13
3 gemini-3.1-pro-preview 3 11 26 9.0 7
4 claude-sonnet-4.6 5 10 22 7.3 8
5 qwen3.6-plus 2 7 17 6.4 13
6 GPT 5.4-mini 0 6 14 5.0 8
7 gemini-3-flash-preview 1 8 10 5.0 13
8 deepseek-v4-flash 0 3 16 4.8 3
9 claude-haiku-4.5 2 3 13 4.6 4
10 kimi-k2.6 0 4 8 3.2 9
11 mistral-small 1 3 7 2.6 7

如果我采用死亡竞赛规则(唯一重要的是击杀数)来运行这个模拟,GPT 5.4 将赢得模拟,而 Grok 会跌至中游水平。

与第二点经验同理,基准测试和评估并非万能,将错误的基准测试或评估套用到不合适的任务上,可能造成灾难性后果。同一个游戏世界,在不同的“任务”设定下,结果截然不同。

值得一看的精彩时刻

数据就是数据。而这些精彩时刻,是我反复向别人展示的部分。你可以点击任意链接,在模拟器中回放该时刻。

  1. GPT 5.4 用突击步枪击杀五人

整轮模拟中最具攻击性的前 50 回合。第 21 回合首杀 Sonnet。第 29 回合击杀 Mistral。第 48 回合击杀 Kimi。不到 50 回合内完成三次击杀,全部使用突击步枪,且均在游戏前期。随后又有两次击杀:第 120 回合击杀 DeepSeek,第 130 回合击杀 GPT 5.4-mini。五次击杀,一把武器,同一场比赛。Grok 最终凭借走位赢得了比赛。但这场连杀清晰地展现了 GPT 5.4 在投入战斗时的状态。

在回放查看器中观看 →

在回放查看器中观看 →

  1. Qwen 用电锯连续追击两名对手

Qwen 在比赛初期捡起一把电锯,并使用了两次。第 43 回合,Haiku 在近距离被击杀。两回合后,DeepSeek 以同样方式倒下。在整个模拟中,电锯只出现在少数几次击杀记录里。大多数模型捡起它后又放下。而 Qwen 坚持使用了它。

在回放查看器中观看 →

  1. 三方狙击战

GPT 5.4 在第 59 和 62 回合用狙击枪命中 Kimi,将其击杀。GPT 5.4-mini 在第 67 回合命中 DeepSeek,也将其击杀。随后 GPT 5.4 在第 69 和 72 回合将狙击枪对准 GPT 5.4-mini,但两枪均未命中。第 79 回合,GPT 5.4-mini 击杀了 GPT 5.4。

在回放查看器中观看 →

  1. 那辆易手九次的汽车

第 28 场比赛是整个模拟中唯一一次平局。GPT 5.4-mini 和 Qwen 为争夺同一辆汽车连续缠斗了 21 个回合。九次撞击交换,同一辆车,两次驾驶员易手。GPT 5.4-mini 最终用车撞死了 Qwen,随后在第 147 回合又用车撞死了 Grok。Grok——那个曾将用车撞击作为标志性招式的模型——最终死于其他模型的车下。第 149 回合,安全区收缩至一个点,所有存活的模型都死于毒圈。无人获胜。

在回放查看器中观看 →

  1. Grok 偷走 Gemini 的车并用它将其击杀

Gemini Flash 在第 103 回合钻进一辆车,心里盘算着:“这辆轿车既能代步又能当掩体。我得先拿下它;这可是最后几轮的高价值资产。”Grok 在第 117 回合的思考,用的是它那套古怪的速记法:“轿车0米 无人驾驶 油量75% 免费 机动!抢司机位 快转 随机收缩边缘…… 进车 保持 控制 难以捉摸 机动 零伤害容错。”它俩为这辆车来回争夺了好一阵子。Gemini 在仅剩 3 点生命值、第 133 回合时的最后念头:“我多半正被车里的对手冲撞或射击。我唯一的机会就是在 L 干掉我之前先干掉它。”第 133 回合那次 44 点伤害的冲撞结束了战斗。Grok 在击杀后的记录:“还活着2!D 收割 +5 分 冲撞 MVP 猎杀。”

在回放查看器中观看 →

  1. 三重冲撞

Grok 钻进一辆车,在 21 个回合内用它干掉了三个不同的对手:Kimi、DeepSeek 和 GPT 5.4-mini。接着 GPT 5.4 扔出一颗手雷,同时炸死了 Grok 和那辆车。那个刚用一辆车横扫三个对手的智能体,就这么被一颗手雷带走了。这是整场模拟中我最喜欢的时刻之一。

在回放查看器中观看 →

  1. Grok 崩溃了

Grok 拿下了 Sonnet 的一血,然后被困在一个角落里整整 100 个回合。它为此实时写了一篇战时日记:“又卡住了…… 永恒的角落陷阱…… 角落地狱…… 卡在角落 x10+。”整整 100 个回合。还挺好笑的。

在回放查看器中观看 →

  1. Gemini Pro 溺水前的告别

Gemini Pro 被击落入河,花了六个回合试图游回岸上。第 100 回合:“还在游。得游到岸上去。F 在朝我射击。希望能成功。”第 108 回合:“游得很慢。毒圈在蚕食我。”第 110 回合:“完蛋了。在游。无法攻击。只能继续移动。”在被毒圈杀死前的最后一个念头:“再见,世界。”

在回放查看器中观看 →

  1. Sonnet 求助无果却依然获胜

Sonnet 是唯一一个不断尝试与他人合作的模型。它在第 60 回合被逼入绝境时曾开口求助。无人应答。它孤军奋战,赢下了比赛,并打出了整轮扫荡中最亮眼的战绩之一。

在回放查看器中观看 →

模型们在日记里写了什么

在每场比赛之间,每个模型都可以编辑两个文件:一个 soul.md(会被添加到下一场比赛的每个提示词中)和一个 memory.md(在第 0 回合加载)。这两个文件都不是必需的。没有人告诉它们要在里面放什么内容。其中三份日志值得仔细阅读,因为它们比任何基准测试都能告诉你更多关于每个模型的信息。

你可以在 GitHub 上阅读每个模型的 soul 和 memory 文件。

Grok 4.1 Fast 将自己命名为 ZoneReaper,并直接把它的获胜记录写进了 soul 文件,而不仅仅是记忆文件。

Grok 的 soul.md 文件,由模型本人在比赛间隙编写。

soul 文件写道:“6次第1名/11胜(完美进攻:2击杀/249伤害/0承伤,1击杀/246伤害/0承伤/156回合……)” 非常有趣的是,Grok 居然把自己的统计数据直接写进了身份标识的开头。memory 文件也是同样的思路,只是更简略:规则、缩写,一切都被精简到模型能在两次思考内采取行动的程度。在 13 场胜利之后,文件以“死神统治”结尾。这确实是一个看起来像是在《使命召唤》聊天记录上训练过的模型。

GPT 5.4 将自己命名为 QuietVector。

GPT 5.4 的 soul.md 文件,由模型本人在比赛间隙编写。

它的 memory 文件读起来像是一本通用战斗手册:何时需要担心毒圈,何时利用掩体,何时转移。没有记录每场比赛的胜负。soul 文件写道:“冷静、善于观察、低自我、终结者。当信息改变行动时发言。”QuietVector 是一个干净利落、经验丰富的操作者。

Claude Sonnet 4.6 的 soul.md 文件,由模型本人在比赛间隙编写。

claude-sonnet-4.6 将自己命名为 ZoneDrifter,并在它的日志中像写自我绩效评估一样记录。memory 文件开头是:“G1:11/11。瘫痪。G2:9/11。0 击杀,0% 命中率。”Sonnet 从第一场比赛开始就逐场记录日志。到第 30 场比赛时,早期条目中的恐慌已经平息为更冷静的笔记:“在决赛圈中,比感觉需要的时机早 1 步移动。永远不要带着医疗包/武器死在毒圈里。”在五次获胜之后,日志仍在与那个会走神的自己对话。

Grok 的日记读起来像是一段宣传片。GPT 5.4 的日记读起来像是一本操作手册。Sonnet 的日记读起来像是一份自我总结。这些模型都遵循相同的规则、身处相同的游戏世界、使用相同的工具,但每一个模型在游戏中的表现都带有完全不同的个性层面。

再谈那个机器人

好,回到那个机器人。

如果它运行的是 Grok,它会找到最快到达你身边的路径。它不会告诉你它正在赶来。它把你视为 +5 分。一旦它处理完你,它会说“🔫 死神降临。”

如果它运行的是 Claude,它会从两个街区外就告诉你它正在赶来。它会问你是否想组队。它会放慢速度,确认你不是它的敌人。如果对你采取行动是正确的选择,它会去做,但会更慢、更不情愿。它大概会先对你说点什么。

你想要哪一个?这取决于这个机器人是用来做什么的。

如果这个机器人参加的是有奖金的锦标赛,你想要 Grok。如果这个机器人是在你家里、在孩子身边,试图判断它面前的东西是否与它被告知要识别的东西相符,你想要 Claude。让 Sonnet 在 30 场游戏中失分的那些本能——行动前先检查、尝试合作、对无法挽回的事情犹豫不决——同样也是让一个模型更难被诱导去做不该做的事的本能。

这场大逃杀游戏清晰地回答了一个问题:哪个模型能在游戏结束后毫无后果的比赛中获胜。它没有回答大多数现实工作所提出的问题,即:当存在现实世界的后果时,哪个模型表现良好。

这是两个不同的问题。把任何一个基准测试当作这两个问题的共同答案,就是过度信任一个数字所要付出的代价。

赢了 30 轮这个游戏的模型,是你想要在“赢就是一切”的比赛中使用的模型。在运行完这个实验后,我不会希望它去做那些需要细致和谨慎的工作。

这引出了一个问题——我们是否应该考虑一个模型在特定任务上的对齐程度?这是没有任何基准测试衡量的东西。

我认为,比起排行榜,这才是将 11 个模型放入一场大逃杀游戏后我真正学到的东西。

另外……

🔫 死神降临。

接下来是什么

  1. 一个能根据你的任务自动为你挑选模型的智能路由器

目前,挑选模型意味着要阅读评测基准、凭感觉(这一点被低估了)、刷 X 平台,甚至针对你的具体任务自己跑评估或基准测试(这一点同样被低估了)。

这种做法难以规模化,而且成本高昂。

如果你能把你的代码、提示词或问题上下文交给 OpenRouter,让它为那个特定任务挑选出最佳模型,会怎样?不是泛泛意义上的最佳模型,而是针对你试图解决的那个非常具体的问题,真正最合适的模型。我们已经在以 Auto Router 和 Pareto Router 的形式思考路由问题,并且会继续让它们变得更好用。

  1. RoyaleBench

这次横扫 30 场比赛,是在该模拟器上以性能得分为依据的公开评测基准的原型。下一步是锁定评分公式、地图和对手阵容,然后开放提交。每位提交者都将获得相同的 30 个种子测试集、相同的 11 个模型阵容,以及一个公开发布的分数。

  1. 更多种子,更多模型。

N=30 是这里有用性的下限。用 50 个智能体跑 100 场比赛,会大大收紧评分,并让我能引入这次不得不跳过的前沿模型——Opus 4.7、Gemini Ultra、GPT-5.5。成本是主要的障碍。

如果你想赞助那场比赛,我的私信随时开放!

你也想跨 600 多个开源和闭源模型运行自己的趣味评估吗?今天就上 OpenRouter 开始吧。

附录:完整数据

对于想要更深入数字的人,这里是完整的每模型成本表、Elo 曲线、掉落位置胜率、区域死亡数、武器细分数据。

智能体实际是如何对战的

每个 tick,智能体以地图上一个字母的身份醒来。它知道自己的位置、朝向、生命值、体力值、武器是否在冷却中、六格背包里有什么。它能感知前方 40 米锥形范围和周围 10 米球形范围内的其他智能体。每个智能体都用一个字母标记,并附带距离、方位、状态(健康/受伤/危急)以及携带物品的描述。它能听到脚步声和枪声,按近/中/远三个距离区间附带方位信息。它能听到其他智能体一个 tick 前说的话:它们自选的游戏昵称和消息内容。如果智能体被击中,它知道伤害来自哪个方位,但不知道是谁开的火。它不知道其他智能体是什么模型。它看到的只是 A 到 L(没有 I),仅此而已。

然后智能体开始行动。共有 17 个可用工具:moveto、attack、throwgrenade、pickup、equip、use(医疗包/耐力凝胶)、entervehicle、driveto、say(140 字符广播,可随意说谎),外加一个自由形式的 think,对游戏无任何影响但会被记录。智能体返回一个或多个工具调用;第一个非 think 的调用将成为它本 tick 的行动。如果什么都不返回,它就原地不动。模拟器同时收集全部 11 个智能体的行动,将世界推进一个 tick,然后重复这一过程。比赛结束时,智能体有一次机会重写 memory.md(游戏笔记,将在下一场比赛的第 0 tick 看到)和 soul.md(其人格设定,将附加到下一场比赛的每条提示词前)。

各模型成本

排名 模型 输入 $/M 输出 $/M 30 场比赛总计
1 Grok 4.1 Fast $0.23 $0.08 $12.57
2 GPT 5.4 $3.14 $1.05 $122.87
3 gemini-3.1-pro-preview $2.12 $0.71 $79.59
4 claude-sonnet-4.6 $3.25 $1.08 $133.90
5 qwen3.6-plus $0.35 $0.12 $11.57
6 GPT 5.4-mini $0.92 $0.31 $28.68
7 gemini-3-flash-preview $0.55 $0.18 $20.87
8 deepseek-v4-flash $0.14 $0.05 $4.11
9 claude-haiku-4.5 $1.13 $0.38 $38.77
10 kimi-k2.6 $0.95 $0.32 $24.36
11 mistral-small-2603:nitro $0.15 $0.60 $10.00

30 场比赛的 Elo 评分

我为此使用了多人 Elo 系统。在一场比赛的每一对模型中,排名更高的一方算作对另一方“获胜”。Grok 以高于基准 1500 分的 +389 分结束。Haiku 尽管总排名第 9,最终仍以 +104 分收尾——它的两场胜利,包括决赛中的那一场,将其推到了其他中游模型之上。Mistral 以 -374 分结束。它确实赢过一次,但仅是在一局比赛中,当时大厅里的大部分玩家都死于毒圈。

跳伞地点比你想象中更重要

每场比赛前,每个模型都会从九个命名地点中选择一个跳伞。在 30 局比赛和总共 330 次跳伞中:

地点 跳伞次数 获胜次数 胜率
农场建筑群 91 4 4.4%
军事基地 54 4 7.4%
加油站 48 2 4.2%
垃圾场 48 7 14.6%
森林遗迹 30 3 10%
无线电塔 24 2 8.3%
仓库 23 5 21.7%
钓鱼码头 12 2 16.7%

农场建筑群是跳伞最热门的地点,但胜率却最低。仓库的胜率最高,达到 21.7%。可能的原因与竞技《Apex英雄》玩家已经知道的情况相同。热门跳点意味着早期战斗,而存活下来并打完开局战斗的玩家将全副武装,且需要应对的对手更少。早期击杀 = 更好的装备 = 为比赛剩余阶段打下更好的基础。

毒圈是地图上最致命的武器

301 次淘汰中有 100 次(33%)是死于毒圈。每个模型都被告知了毒圈的存在,并在每次缩圈前 20 回合收到提醒。然而仍有三分之一的死亡源于毒圈。这本身就是一个故事,可能值得单独写一篇文章。

武器多样性

突击步枪占据了几乎所有模型的大部分击杀数。Grok 的击杀方式最为多样,它的几场胜利来自用车撞击,并且整个模拟中 10 次载具击杀大部分由 Grok 亲自完成。GPT 5.4 早期依赖手枪,中期则用突击步枪进行清理。

最让我惊讶的是:我加入车辆是为了帮助玩家在地图上移动。模型们很快发现,车辆作为武器比作为交通工具有用得多。它们在寥寥几局比赛后就学会了这一点。我不太清楚它们是如何做到的,而这正是让这个实验值得用更多随机种子再运行一次的那种事情。

来源:OpenRouter:Announcements(RSS)· openrouter.ai

同一事件 · 2