karminski-牙医@karminski3
51AI 编辑部评分,满分 100

GLM-5.3 跑分暴涨6倍引热议

2026-08-14 20:09· 2小时前
AI 导读

GLM-5.3 在 Terminal Bench 3.0 测试中分数翻了6倍,引发关注。该基准测试任务难度高,如 exam-pdf-eval 需模型调用第三方 VLM 并自行编写 prompt 完成闭环验证。博主推测 GLM-5.3 在复杂真实环境下的架构规划能力将非常强,并预告稍后带来实测。

啊?GLM-5.3的测试分数是怎么翻6倍的?

有一说一这个分数飞升有点猛了, 按我对 Terminal Bench 3.0 的理解, 里面的任务是实打实的难的.

比如这个 exam-pdf-eval, 就是个给考试试卷(PDF格式)评分的任务, 模型并不是自己直接解析PDF然后阅卷评分的, 而是要调用一个VLM, 然后自己写prompt, 让 VLM 抽取试卷内容, 然后再评分.

这是个最近特别火的概念, 叫[clarify model-specific prompt formatting]澄清特定模型的提示词格式, 也就是说, 模型要构建一个基于第三方黑盒的闭环验证系统. 这个VLM就是最大的变数.

以往来看, Terminal Bench 3.0 中的问题 Anthropic 系列的模型能打高分, 是因为有部分题目就是他们的研究员出的. 基本是御用测试题了.

但这次的跑分图,GLM-5.3 直接翻了六倍!所以估计 GLM-5.3 这次在复杂真实环境下做架构规划的能力会非常强.

尤其是面对黑盒 API, 不可预知的命令行报错和自己写 Prompt 的套娃任务,都会有不错的表现.

稍后我会给大家带来实测!

#glm53 #glm #terminalbench

来源:karminski-牙医 · x.com

GLM-5.3 跑分暴涨6倍引热议

karminski-牙医 · @karminski3 · X·2026-08-14 20:09·2小时前
AI 导读

GLM-5.3 在 Terminal Bench 3.0 测试中分数翻了6倍,引发关注。该基准测试任务难度高,如 exam-pdf-eval 需模型调用第三方 VLM 并自行编写 prompt 完成闭环验证。博主推测 GLM-5.3 在复杂真实环境下的架构规划能力将非常强,并预告稍后带来实测。

啊?GLM-5.3的测试分数是怎么翻6倍的?

有一说一这个分数飞升有点猛了, 按我对 Terminal Bench 3.0 的理解, 里面的任务是实打实的难的.

比如这个 exam-pdf-eval, 就是个给考试试卷(PDF格式)评分的任务, 模型并不是自己直接解析PDF然后阅卷评分的, 而是要调用一个VLM, 然后自己写prompt, 让 VLM 抽取试卷内容, 然后再评分.

这是个最近特别火的概念, 叫[clarify model-specific prompt formatting]澄清特定模型的提示词格式, 也就是说, 模型要构建一个基于第三方黑盒的闭环验证系统. 这个VLM就是最大的变数.

以往来看, Terminal Bench 3.0 中的问题 Anthropic 系列的模型能打高分, 是因为有部分题目就是他们的研究员出的. 基本是御用测试题了.

但这次的跑分图,GLM-5.3 直接翻了六倍!所以估计 GLM-5.3 这次在复杂真实环境下做架构规划的能力会非常强.

尤其是面对黑盒 API, 不可预知的命令行报错和自己写 Prompt 的套娃任务,都会有不错的表现.

稍后我会给大家带来实测!

#glm53 #glm #terminalbench

来源:karminski-牙医· x.com