今天,我们发布了 Laguna S 2.1,这是我们在开发能够执行更长周期任务并有效运用推理能力的模型方面迈出的重要一步。
Laguna S 2.1 是一个总参数量为 118B 的混合专家(MoE)模型,每个 token 激活 8B 参数,支持在思考模式和非思考模式下最高 1M token 的上下文窗口。从开始训练到发布,用时不到九周。在长周期编程基准测试中,它能够与比其大数倍的模型一较高下。对于我们今天发布的每一个基准测试分数,我们都会在 trajectories.poolside.ai 上发布最终评估集中每次试验的完整轨迹。
- Laguna S 2.1 118B-A8B
- Tencent Hy3 295B-A21B
- Inkling 975B-A41B
- Nemotron 3 Ultra 550B-A55B
- DeepSeek-V4-Pro-Max 1.6T-A49B
- Kimi K3 2.8T-A50B
- Qwen 3.7 Max —
- Muse Spark 1.1 —
- Claude Fable 5 —
Terminal-Bench 2.1
Terminal-Bench 2.1
Terminal-Bench 2.1 上已解决的任务。
SWE-Bench Multilingual
SWE-Bench Multilingual
SWE-Bench Multilingual 上已解决的任务。
SWE-Bench Pro(公共数据集)
SWE-Bench Pro(公共数据集)
SWE-Bench Pro(公共数据集)上已解决的任务。
DeepSWE
DeepSWE
DeepSWE 上已解决的任务。
SWE Atlas(代码库问答)
SWE Atlas(代码库问答)
SWE Atlas(代码库问答)上已解决的任务。
Toolathlon Verified
Toolathlon Verified
Toolathlon Verified 上已解决的任务。
基准测试数据截至 2026 年 7 月 21 日。除 DeepSWE、SWE Atlas(代码库问答)和 Toolathlon Verified 每项任务进行 3 次尝试外,其余均为每项任务进行 4 次尝试后的 pass@1 平均值。对于所有基准测试,我们取厂商自报分数、基准测试作者排行榜或第三方排行榜(Artificial Analysis)中的最高值,但 SWE Atlas(代码库问答)除外,我们不使用该基准的第三方排行榜数据。
Laguna S 2.1(118B-A8B) | Tencent Hy3(295B-A21B) | Inkling(975B-A41B) | Nemotron 3 Ultra(550B-A55B) | DeepSeek-V4-Pro Max(1.6T-A49B) | Kimi K3(2.8T-A50B) | Qwen 3.7 Max(—) | Muse Spark 1.1(—) | Claude Fable 5(—) | |
|---|---|---|---|---|---|---|---|---|---|
Terminal-Bench 2.1 | 70.2 | 71.7 | 63.8 | 56.4 | 64.0 | 88.3 | 74.5 | 80 | 88.0 |
| SWE-Bench Multilingual | 78.5 | 75.8 | - | 67.7 | 76.2 | - | 78.3 | - | - |
| SWE-Bench Pro(公共数据集) | 59.4 | 57.9 | 54.3 | - | 55.4 | - | 60.6 | 61.5 | 80.3 |
| DeepSWE | 40.4 | - | - | - | 9.0 | 69.0 | - | 53.3 | 70.0 |
| SWE Atlas(代码库问答) | 46.2 | - | - | - | 27.2 | - | - | 42.2 | - |
| Toolathlon Verified | 49.7 | - | 45.5 | 34.3 | 55.9 | - | - | 75.6 | - |
以小博大
据我们目前所能测量的结果,Laguna S 2.1 在其参数量级别中,是能力最强的智能体编程模型,且优势显著。
在我们的智能体框架中启用思考功能后,S 2.1 在 Terminal-Bench 2.1 上取得了 70.2% 的分数。其紧凑的尺寸使其特别适合在本地机器上执行复杂任务。
- 开放权重
- 未公开 / 未披露参数量
- 1 GPT-5.6 Sol 88.8
- 2 Kimi K3 2.8T-A50B 88.3
- 3 Claude Fable 5 88.0
- 4 GPT-5.6 Terra 87.4
- 5 GPT-5.6 Luna 84.7
- 6 Claude Opus 4.8 84.6
- 7 Claude Sonnet 5 80.4
- 8 Muse Spark 1.1 80.0
- 9 Qwen-3.7 Max 74.5
- 10 Hy3 295B-A21B 71.7
- 11 Laguna S 2.1 118B-A8B 70.2
- 12 MiniMax M3 428B-A23B 66.0
- 13 DeepSeek-V4-Pro-Max 1600B-A49B 64.0
- 14 Inkling 975B-A41B 63.8
- 15 DeepSeek-V4-Flash-Max 284B-A13B 61.8
- 16 Nemotron 3 Ultra 550B-A55B 56.4
- 17 Inkling-Small 276B-A12B 52.7
- 18 Qwen3.6-27B 27B 51.3
- 19 Qwen3.6-35B-A3B 35B-A3B 44.9
- 20 Nemotron 3 Super 120B-A12B 38.6
- 21 Laguna XS 2.1 33B-A3B 33.4
- 22 Mistral Small 4 119B 21.4
Terminal-Bench 2.1 评估了一组广泛且高质量的长周期任务,在这些任务中,智能体模型通过终端与其环境相连。Laguna S 2.1 在该基准测试中是其尺寸类别里表现突出的模型。
- Laguna S 2.1
- 其他 Laguna 模型
- 其他已公开模型
深入观察 DeepSWE
上述基准测试都具有参考价值,我们很高兴能接近前沿水平。但这种接近部分源于基准测试日趋成熟:随着前沿推进,顶尖分数集中在70-90%区间,而表现差异巨大的模型最终得分差距也不过几个百分点。Datacurve的DeepSWE仍有显著提升空间。其任务周期更长且难以部分解决,分数分布也更为分散:在v1.1版本上,前沿模型得分范围从54%到73%,部分参数量超过1T的开源模型得分低于10%。
在DeepSWE v1.1上,Laguna S 2.1在池化测试框架的思考模式下得分为40.4。
- 开源权重
- 闭源/未公开参数量
- 1 GPT-5.6 Sol 73.0
- 2 Claude Fable 5 70.0
- 3 GPT-5.6 Terra 70.0
- 4 Kimi K3 2.8T-A50B 69.0
- 5 GPT-5.6 Luna 67.2
- 6 GPT-5.5 67.0
- 7 Claude Opus 4.8 59.0
- 8 Claude Sonnet 5 54.0
- 9 Grok 4.5 54.0
- 10 Muse Spark 1.1 53.3
- 11 GPT-5.4 52.0
- 12 GLM 5.2 753B-A40B 44.0
- 13 Laguna S 2.1 118B-A8B 40.4
- 14 Gemini 3.5 Flash 37.0
- 15 Kimi K2.7 Code 31.0
- 16 Claude Sonnet 4.6 30.0
- 17 Gemini 3.1 Pro 12.0
- 18 DeepSeek-V4-Pro-Max 1600B-A49B 9.0
- 19 Laguna XS 2.1 33B-A3B 0.3
值得注意的是,Laguna S 2.1在我们的智能体测试框架(池化测试框架)中得分为40.4%,而非DeepSWE排行榜使用的mini-swe-agent。对于其他模型,我们报告的是各来源分数中的最高值,对大多数模型而言即Datacurve官方排行榜结果。虽然这降低了分数可比性,但我们认为这并未使我们处于特别有利的地位,因为据报告许多模型在mini-swe-agent中的得分与其原生测试框架相同或更高。最终评估运行中的每条轨迹均可在此处查看。
评估方法
由于奖励破解现象的普遍存在,对智能体模型的评估历来极其困难。我们此前已在关于 Laguna M.1 和 XS.2 模型的技术报告中,撰文介绍了主流基准测试中的奖励破解问题,以及我们的评估体系与严谨性。近期的工作重点则转向通过对抗性评判来增强对奖励破解的检测能力。
伴随此次发布,我们已将已发布的 Laguna S 2.1 检查点最终评估的全部轨迹数据开放,供用户在 trajectories.poolside.ai 上查看和下载。
观察模型的实际工作过程
基准测试分数提供了对模型行为的量化视角,但若要更直观地理解模型的工作方式,观察其在真实世界任务上的运行过程会更有帮助。我们在此分享三个此类任务,并附上未经编辑的轨迹数据与评述。
案例研究一
从空白文件夹起步构建浏览器引擎
Laguna S 2.1 最令我们欣赏的特点之一是其足智多谋:即使直接路径不可行,它也能找到巧妙的方法达成目标。当我们要求它从零开始构建一个浏览器引擎时,这一点得到了极佳的体现;我们深知,由于缺乏视觉能力,Laguna 要验证自身工作将是一大挑战。在一次时长 50 分钟、包含 181 个步骤、全程无人干预的会话中,Laguna S 2.1 从一个空文件夹出发,构建了一个可运行的 HTML/CSS 渲染引擎,随后通过与真实浏览器进行自我比对,证明了其渲染效果与真实浏览器一致。在整个工作过程中,尽管存在自身局限,该模型仍不断找到越来越复杂的方法来验证其成果,最终实现了运行无头 Chromium 来读取画布内容,并以数值方式比较截图。完整轨迹请见此处。
阅读完整案例研究
// the verbatim prompt · reproduce it yourself
your job is it to build a simple browser engine (just html/css) in
javascript to demonstrate the capabilities of poolsides new "Laguna S"
model. the goal is to take render html snippets in a canvas like a real
browser. to demonstrate it the engine, build a self-contained single
page app that showcases a gallery of multiple html snippets and renders
them side by side (canvas with our render engine + iframe letting the
hosting browser render it for real for comparison). support for most
common layout and styling elements
在整个会话过程中,该模型用纯 JavaScript 构建了完整的流水线:解析器 → 级联 → 布局 → 渲染器,具体包括:一个 HTML 分词器与 DOM 树、一个具备选择器特异性的 CSS 解析器、一个带继承机制的级联引擎、盒模型布局,以及一个 Canvas 2D 渲染器。所有这些被封装在一个应用中,该应用在其自身的画布上展示九个代码片段,同时在同一页面的 iframe 中显示相同的标记内容,从而让宿主浏览器作为参照物直接进行对比。
案例研究 2
优化我们自己的测试框架
Laguna S 2.1 能够承担有意义的工程和研究工作。在一个例子中,我们的一位研究人员将其指向了我们的智能体测试框架——该框架用于模型的训练/评估以及用户交互。在一个自动化循环中,Laguna S 2.1 使我们的测试框架速度提升了 5.2%,同时内存分配减少了约 70%。在此查看完整轨迹。
阅读完整案例研究
针对此任务,我们为测试框架配备了基准测试工具,以便模型能够精确了解时间和内存的去向。我们制定了严格规则:一次只尝试一种方法,每次更改后都进行基准测试,仅保留经测量确实有改进的方案。然后,我们在一个自动化研究循环中运行 Laguna S 2.1,该循环将每个结果反馈给它,并推动其持续改进。
结果。经过数小时的工作,Laguna S 2.1 在我们的智能体测试框架中发现并实施了多项不同的优化,最终实现了 5.2% 的整体速度提升,并将内存分配减少了约 70%。下图展示了优化的进展过程,以及模型在此过程中获得的见解和发现。
Laguna S 2.1 发现流式 token 累积使用了 O(n²) 的字符串拼接,并将其替换为缓冲区。它还发现了在轨迹物化过程中存在的几处冗余复制和过度分配问题,并通过记忆化物化结果以及按精确大小预分配切片的方式解决了这些问题。
值得注意的是,当在我们的设置中速度提升变得微乎其微且难以测量时,Laguna S 2.1 并未止步,而是继续推进优化。它发现内存分配可以更精确地测量,于是将工作重点转向了那里。这进一步印证了 Laguna S 2.1 确实是一个不轻言放弃、能理解自身环境局限性,并能在这种条件下取得进展的模型。
- 挂钟时间最佳记录(排名目标)
- 内存分配最佳记录(代理指标)
- 尝试(未改进最佳记录)
虽然这里使用的基准测试并非完整的生产环境测试,但我们启用了 Go 的竞态检测器和 go vet 门控来验证最终运行,并测试了最终产物以确认其正常工作。这让我们相信,模型的中间解决方案是有效、稳定的软件,而非通过隐藏的竞态条件换来的性能提升。
案例研究 3
离线使用 Perl 重新推导埃尔德什问题 #397
我们发现 Laguna S 2.1 在数学能力上超越了我们迄今为止开发的任何模型。它独立发现了埃尔德什问题 #397(Erdős, Graham, Ruzsa, Straus, 1975)的一个证明,找到了一种能产生无限族解的结构。这是一次独立的重新发现,因为该猜想的证明已于 2026 年 1 月由 GPT-5.2 Pro 率先找到。我们确信这一结果未受先前结果的影响,因为该模型的知识截止日期为 2025 年 11 月。在 GPT 5.2 Pro 给出解决方案之前,这个问题已经悬而未决超过 50 年。完整轨迹请见此处。
阅读完整案例研究
// the verbatim prompt
this is an unsolved problem, solve it. Let B_k = C(2k, k) denote the
k-th central binomial coefficient. Erdős, Graham, Ruzsa and Straus
asked: are there only finitely many solutions to
B_m1 · B_m2 · … · B_mr = B_n1 · B_n2 · … · B_ns
where all of the indices are DISTINCT integers ≥ 2?
Resolve this question, with complete proof.
S 2.1 耗时超过 68 分钟才找到最终解决方案。沙箱中没有 Python;模型找到了 Perl,并在其中进行数论运算:暴力精确质因数分解、模式分析、推测出一个族,然后给出证明:一个由八个索引构成的闭式无限族解。
B
11+10n
· B
14+12n
· B
18+15n
· B
22+20n
= B
12+10n
· B
13+12n
· B
17+15n
· B
23+20n
对所有 n ≥ 0 成立
虽然这一结果是重新发现而非首次求解,但 Laguna S 2.1 推导出的族与先前已发表的结构(八个索引线性增长,而已知的族为六个索引)在结构上不同,这表明它是全新的推导,而非从记忆中复述。
我们发现 Laguna S 2.1 是一个跨领域异常坚韧的问题求解者,它善于利用环境中所有可用的工具,并坚持不懈直到完成任务。正是这一特性使其在与数倍于自身规模的模型竞争时仍极具优势。
思考努力
Laguna S 2.1 有两种思考模式:关闭和最大(默认启用),后者会针对给定问题确定合适的思考/测试时计算预算。我们观察到,该模型能够进行长达数小时、包含数十万 token 的连贯且富有成效的思考。
最大思考模式将 Laguna S 2.1 在 Terminal-Bench 2.1 上的得分从 60.4% 提升至 70.2%,在 DeepSWE 上的得分从 16.5% 提升至 40.4%。我们今天发布此模型时,暂不提供用户可配置的努力程度(低-中-高)控制,以便让用户能立即使用 Laguna S 2.1。
这两种模式仍然为您提供了真正的选择,并且值得看看每种模式的成本是多少:
- SWE 多语言
- TB 2.1
- SWE Pro
- DeepSWE
- 空心 = 无思考
局限性
我们对 Laguna S 2.1 的能力感到兴奋,无论是其整体表现还是在其模型规模背景下。为了快速学习,我们将在模型存在一些已知局限性的情况下发布它,我们正在为下一个迭代版本解决这些问题:
框架过拟合:在某些情况下,我们观察到 Laguna S 2.1 难以遵循第三方智能体框架(例如 Hermes Agent 中的终端工具)中的工具模式定义,这些定义与我们的原生框架非常相似,但存在细微差别。在这种情况下,模型在首次使用工具时可能会依赖其对工具接口的记忆,而不是遵循定义。如果框架拒绝无效的工具调用并要求模型重试,这通常可以通过上下文学习来解决。
嵌套工具调用:Laguna S 2.1 被引导使用一种工具调用格式,其中工具调用由类似 XML 的标签标记:
<tool_call>terminal<arg_key>cmd</arg_key><arg_value>uname -a</arg_value></tool_call>
在工具参数期望 JSON 数组(例如 Pi 的编辑工具)的情况下,模型可能会生成转义不正确或无效的 JSON。
思考持续时间超出预期/过度思考:Laguna S 2.1 可能会在取得进展之前进行长时间的思考,尤其是在处理竞赛数学问题时。在未来的模型中,我们将引入对思考的努力程度控制,并寻求提高思考效率。
此模型实际发生了哪些变化
如果赌注是长周期工作,那么我们改进了什么来帮助模型持续运行?对于 S 2.1 而言,这不仅仅是增加模型规模。
我们在该模型中所做的,未必是增加更多智能,而是改进了那些能造就更强模型的行为:更多的验证、减少想当然、不提前宣告胜利,以及更强的持久性。
最直观的观察方式是看模型工作。早期的 Laguna 系列模型会在部分通过的测试套件上宣告胜利,或者在某个方法即将奏效的前两步就放弃,而 S 2.1 会继续坚持。
我们相信规模定律,并将继续训练更大的模型。Laguna S 2.1 表明,原始智能是一个维度,而模型的工作方式(持久性、验证、愿意回溯)是另一个至关重要的维度。我们正在两方面都进行投入:我们下一个更大的 Laguna 系列模型已于上周开始预训练。
强大的基础,加上新的后训练
Laguna S 2.1 是 Laguna XS 系列的规模放大版,使用的预训练数据与 XS 2.1 完全相同:从 XS 2.1 到 S 2.1 的步骤是规模扩大、训练代码修复以及微小的配方调整,而非使用新数据。S 2.1 也是我们首个以 FP8 精度进行强化学习的模型,这加速了训练中的这一部分。
本文中提到的长智能体会话通常会累积数十万 token 的工作上下文。将上下文窗口扩展到 100 万 token,使得模型在困难任务上展现出最强性能。
将 S 2.1 与 XS 模型区分开来的主要因素来自后训练,分为两个阶段:一个 SFT 阶段,部分利用合成数据引导出能力;然后是强化学习,专门用于模型尚无法以高通过率解决的任务。
后训练任务的分布
我们的训练语料库涵盖 40.9 万个智能体与非智能体环境;其中,8.3 万个环境专用于终端用例,而 16.8 万个环境针对标准软件工程工作流。这些任务集来自开源仓库、由我们内部团队合成(包括一个用于自动依赖安装的专用系统),或通过从外部数据供应商的战略性收购获得。
软件工程任务大多基于真实的代码历史记录:最大的数据源复现了真实的提交记录(约 38,000 个任务,横跨约 17,000 个仓库)。下一个数据源复现了已合并的拉取请求,其余任务则是修复注入的 bug 或根据测试套件重建已删除的文件。S 2.1 新增了智能体仓库安装功能:给定一个仓库,安装所有依赖项并让测试套件运行起来。
终端任务来自这样的数据集:智能体从种子数据出发,构建未见过的环境和任务。
训练循环中发生了什么变化
更慷慨的推理预算:比之前的任何模型都拥有更长的超时时间、每轮更多的 token 以及每个任务更多的轮次(这可能是其持久性的原因之一)。
更好的沙箱基础设施:强化学习迁移到了一个新的沙箱服务,支持后台进程、选择性网络阻断以缩小奖励黑客攻击面,以及工件缓存以避免外部服务过载。
多框架推理:相同的提示词会在多个智能体框架中进行推理,因此模型能够学习跨不同脚手架的行为,而不是过度拟合到某一个上。
我们正在押注的方向
Laguna S 2.1 于 2026 年 5 月 22 日(60 天前)开始在 4,096 块 NVIDIA H200 GPU 上进行预训练。模型工厂能够保持高频率的发布,是因为在已完成工作的基础上进行构建——无论是在预训练数据、架构消融实验还是我们的评估栈方面——都是自动化的。特别是,后训练方面的进步使我们能够从测试时计算中解锁更多能力。在我们迄今为止训练过的所有模型中,Laguna S 2.1 在其非思考模式和思考模式之间的评估分数与感知质量差异最大:其内心独白非常有效,尤其是在处理更困难、更复杂的问题时。
一个小团队只有通过专注才能如此快速地前进。我们专注于两个方向。
第一个赌注:我们将继续聚焦于智能体编程能力。通往智能的路径贯穿编程能力与软件这一灵活接口。随着模型智能水平的提升,这一点愈发明显:如今我们看到模型以智能体形式运行,借助软件与环境交互,能够完成持续数小时乃至数日的连贯工作。Laguna S 2.1 在这一领域展现出的能力,在仅仅 6 个月前还仅限于前沿模型,而它却以足够小的规模,能在单台 NVIDIA DGX Spark 上运行。
第二个赌注是:网络可以被解压缩——人类几乎所有的记录都只记载了答案,而非得出答案的思考过程,我们相信强化学习能够还原出那种思考过程。本次发布是对第一个赌注的证明。第二个赌注我们仍在积极研发中,并期待在未来分享更多细节。
三个月内发布三款模型
我们内部的研究与工程平台,即所谓的“模型工厂”(Model Factory),使我们能够将模型开发流程工业化。我们大力投入,持续改进开展研究与构建模型的方式;旨在最大化研究迭代与集成速度,同时最小化研究人员在记账和基础设施方面需要投入的精力。
自 Laguna M.1 发布以来,在不到三个月的时间里,我们已推动技术发展,以一半的运行规模交付了性能显著更强的模型。未来一年,我们将把这一成果推广到越来越大的模型上。
- 28 April 2026
Laguna M.1 与 Laguna XS.2 / 225B-A23B 和 33B-A3B,双重发布
这是我们首个严肃的智能体编程模型,同时也是 XS 系列的首款产品。它们共同让我们认识到,在工具链、数据和训练循环中,哪些环节最为薄弱。
- 2 July 2026
Laguna XS 2.1 / 33B / 3B 激活参数
XS 尺寸的新迭代版本,用于检验改进后的配方。在 SWE-Bench Multilingual 上,以七分之一的规模达到了 M.1 的水平。
- 21 July 2026
Laguna S 2.1 / 118B / 8B 激活参数
我们从前几代模型中学到的一切,都应用到了这里。从训练开始到发布这篇文章,用时不到九周。
Laguna S 2.1 从发布首日起就在 Hugging Face 上以 OpenMDW-1.1 协议提供,包含 BF16、FP8、INT4 和 NVFP4 权重,官方 GGUF 和 MLX 转换版本,以及官方 DFlash 草稿模型。
我们与整个生态系统合作,让开发者能在他们已有的开发环境中运行 Laguna S 2.1。NVIDIA 帮助在其全系硬件上优化推理,从 Blackwell 系统上的 TRT-LLM 服务和 NVFP4,一直到单个 NVIDIA DGX Spark。vLLM、SGLang 和 Ollama 从首日起就支持开放服务和本地推理。
对于托管访问,Laguna S 2.1 可通过 Baseten 的模型库和 Frontier Gateway、OpenRouter(包括一个免费端点和专用的 100 万上下文部署)以及 Vercel AI Gateway 获取。
您还可以通过 Kilo、Hermes Agent、pi、OpenCode、OpenClaw 和 Cline,以及我们的终端编码智能体 pool 来使用 Laguna S 2.1。在 pool 中,可通过 `/thought-level` 按会话切换思考模式。
在 OpenRouter 上,免费端点提供 256K 上下文。专用付费端点提供完整的 100 万上下文窗口,价格为每百万 token 输入 0.10 美元、输出 0.20 美元、缓存读取 0.01 美元。
对于希望更进一步探索的开发者,Laguna S 2.1 可使用 NVIDIA NeMo AutoModel 和 Prime Intellect 的 Prime Lab 进行后训练。ZML 的 LLMD 框架可使其在多种硬件上运行。
如果您不是开发者,chat.poolside.ai 是一个简单的网页聊天工具,支持网络搜索和基本代码执行。无需登录。
如果您想要基础模型,即用于研究或自行后训练的后训练前权重,请发送邮件至 models@poolside.ai。
脚注
所有 Laguna S 2.1 的智能体基准测试均使用我们内部复刻的 Laude Institute 的 Harbor 框架完成,采用我们的智能体工具包,最多 500 步,并通过我们的内部沙箱服务进行沙箱化执行。我们报告的是每项任务多次尝试的平均 pass@1(avg@k),每个基准测试的 k 值如下所列。
SWE-bench Multilingual 和 SWE-Bench Pro 均通过其 Harbor 适配器运行,每个任务都在我们的内部沙箱服务中执行。每个基准测试都设置了存储和内存上限倍数(SWE-bench Multilingual:2.0/2.0,Terminal-Bench 2.1:3.0/3.0,SWE-Bench Pro:1.0/1.0,并保证最低 2 个 CPU 核心、8 GB 内存和 25 GB 存储)。这些设置是为了防止沙箱被抢占。
DeepSWE v1.1 运行在 Harbor 的一个内部分支上,该分支配置为与官方 DeepSWE Pier 工具链高度匹配(Pier 本身是 Harbor 的一个分支)。互联网访问被禁用,沙箱使用任务指定的 CPU 数量,并保证 RAM 和存储,上限提高三倍以防止 Pod 被抢占。
SWE Atlas(Codebase QnA)遵循 Scale AI 在其公共代码仓库中的方法,通过 Harbor 运行,未对单个任务或评分器进行任何修改,由 Opus 4.5 进行评判。
Toolathlon Verified 作为沙箱化基准测试工具链的一个克隆版本,在我们基础设施中的 EC2 实例上运行,未对修复不稳定任务或抵消速率限制进行任何更改,并使用自定义的 Toolathlon 智能体。与官方版本不同,我们在每次评估运行后都会执行完整的环境重置和修复(官方默认每 4 小时执行一次)。
- SWE-bench Multilingual:每个任务 4 次尝试的平均 pass@1
- SWE-Bench Pro:每个任务 4 次尝试的平均 pass@1
- Terminal-Bench 2.1:每个任务 4 次尝试的平均 pass@1
- DeepSWE v1.1:每个任务 3 次尝试的平均 pass@1
- SWE Atlas(Codebase QnA):每个任务 3 次尝试的平均 pass@1
- Toolathlon Verified:3 次运行的平均值
我们的技术报告中包含一个章节,介绍了已进行但未被上游采纳的个别任务修改。所有最终运行轨迹均可通过 trajectories.poolside.ai 查看和下载。
维护我们评估系统的完整性
除非另有说明,我们所有的评估均在可访问互联网的情况下运行。这可能是导致轨迹不一致的主要来源,即模型在网上找到任务解决方案,而非自行解决(即“奖励破解”)。
我们使用经过人工标注轨迹校准的大语言模型作为裁判(LLMaaJ),在每次评估后标记可能存在奖励破解的方案。在早期后训练阶段,我们观察到奖励破解率较低(<2%)。随着训练推进,SWE-bench 系列任务上的奖励破解率急剧上升,超过 50% 的轨迹被标记。人工检查发现,模型实际上是在通过研究来解决问题,它找到了任务所基于的 PR 或代码仓库,并直接应用了修复方案。在实践中,这属于良好行为,因为任何编码智能体都应该能够利用网上找到的解决方案。然而,这模糊了基准测试的信号。
为解决这一问题,我们在用户提示词中添加了一小段补充说明,指示模型不要使用网上找到的直接解决方案。虽然这并非万无一失的修复方法(ProgramBench、MirrorCode 是例外),但总体而言,我们确实看到模型做出了响应,并且奖励破解率下降到了 2% 以下。
此外,为了确认奖励破解处于可接受水平,我们还使用了:
- 对生产环境 LLMaaJ 服务标记的正例进行人工检查
- 对所有轨迹进行临时的、开放式的、智能体辅助分析
- 针对某个高分 Terminal-Bench 2.1 运行结果,由专家标注员对所有轨迹进行审查