# GLM-5.3 跑分暴涨6倍引热议

- 来源：karminski-牙医 (@karminski3)
- 发布时间：2026-08-14 20:09
- AIHOT 分数：51
- AIHOT 链接：https://aihot.virxact.com/items/cmssx3ni20lb5roffb52z08i3
- 原文链接：https://x.com/karminski3/status/2088236512332902559

## AI 摘要

GLM-5.3 在 Terminal Bench 3.0 测试中分数翻了6倍，引发关注。该基准测试任务难度高，如 exam-pdf-eval 需模型调用第三方 VLM 并自行编写 prompt 完成闭环验证。博主推测 GLM-5.3 在复杂真实环境下的架构规划能力将非常强，并预告稍后带来实测。

## 正文

啊?GLM-5.3的测试分数是怎么翻6倍的?

有一说一这个分数飞升有点猛了, 按我对 Terminal Bench 3.0 的理解, 里面的任务是实打实的难的.

比如这个 exam-pdf-eval, 就是个给考试试卷(PDF格式)评分的任务, 模型并不是自己直接解析PDF然后阅卷评分的, 而是要调用一个VLM, 然后自己写prompt, 让 VLM 抽取试卷内容, 然后再评分.

这是个最近特别火的概念, 叫[clarify model-specific prompt formatting]澄清特定模型的提示词格式, 也就是说, 模型要构建一个基于第三方黑盒的闭环验证系统. 这个VLM就是最大的变数.

以往来看, Terminal Bench 3.0 中的问题 Anthropic 系列的模型能打高分, 是因为有部分题目就是他们的研究员出的. 基本是御用测试题了.

但这次的跑分图,GLM-5.3 直接翻了六倍!所以估计 GLM-5.3 这次在复杂真实环境下做架构规划的能力会非常强.

尤其是面对黑盒 API, 不可预知的命令行报错和自己写 Prompt 的套娃任务,都会有不错的表现.

稍后我会给大家带来实测!

#glm53 #glm #terminalbench
