啊?GLM-5.3的测试分数是怎么翻6倍的?
有一说一这个分数飞升有点猛了, 按我对 Terminal Bench 3.0 的理解, 里面的任务是实打实的难的.
比如这个 exam-pdf-eval, 就是个给考试试卷(PDF格式)评分的任务, 模型并不是自己直接解析PDF然后阅卷评分的, 而是要调用一个VLM, 然后自己写prompt, 让 VLM 抽取试卷内容, 然后再评分.
这是个最近特别火的概念, 叫[clarify model-specific prompt formatting]澄清特定模型的提示词格式, 也就是说, 模型要构建一个基于第三方黑盒的闭环验证系统. 这个VLM就是最大的变数.
以往来看, Terminal Bench 3.0 中的问题 Anthropic 系列的模型能打高分, 是因为有部分题目就是他们的研究员出的. 基本是御用测试题了.
但这次的跑分图,GLM-5.3 直接翻了六倍!所以估计 GLM-5.3 这次在复杂真实环境下做架构规划的能力会非常强.
尤其是面对黑盒 API, 不可预知的命令行报错和自己写 Prompt 的套娃任务,都会有不错的表现.
稍后我会给大家带来实测!
#glm53 #glm #terminalbench