# DeepSeek V4 Pro 能力高度绑定脚手架

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-08-16 10:47
- AIHOT 分数：70
- AIHOT 链接：https://aihot.virxact.com/items/cmsv8nxwi0bbqrosav8m3jpe7
- 原文链接：https://x.com/AYi_AInotes/status/2088819786687938670

## AI 摘要

DeepSeek V4 Pro 能力高度绑定特定脚手架：同一模型同一任务，首轮塞入 25 个工具仅得 91 分，只给 bash 和 str_replace_editor 两个工具则稳定 96-99 分，两阶段锚定（先极简后解锁）连续 98-99 分。

## 正文

DeepSeek V4 Pro 作为当前最强开源 Agent 模型,有个很离谱的毛病,
或者说是有个真实软肋:
能力高度绑定特定脚手架,
换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91,

也就是说同一个模型,同一套任务,分数能差 7 到 8 分, 区别只在一件事:第一轮你给它用了多少工具,

如果把25 个工具从第一轮全塞进去,91 分,思维链全是 let me,到处乱试, 只给 bash 和 str_replace_editor 两个,稳定 96 到 99, 两阶段锚定--第一轮只给 2 个核心工具,模型真正调用后再解锁完整工具面--连续 98 和 99,

91 和 99,同一个模型,为什么??

V4 Pro 经过强 RL 训练,高能力轨迹被高度条件化在极简接口上,训练时它见的就是这种环境,

你一上来塞 25 个工具加复杂系统提示,等于直接把它推出训练分布,

这时候它除了被干扰了注意力,还相当于被推进了另一个行为模式, 规划者和混乱执行者之间没有过渡,首轮条件直接决定后面整条轨迹,

最讽刺的是官方自己也知道, DeepSeek 跑公开 Agent benchmark 用的就是极简模式,灰测成绩和极简路径高度一致,正式版默认给你 Standard,然后一用就拉,

评测用的脚手架和用户用的脚手架,不是同一个东西,

社区已经出了补丁, dsh-routing-suite 和 dsh-anchored-standard,自动第一轮极简锚定,首次工具调用后挂档解锁, 不想装插件就自己写状态机,第一轮只暴露两个核心工具,模型真调用了再注入剩下的,

最低成本验证:同一个任务,Standard 跑一遍,极简跑一遍,看思维链起手词, let me 开头是混乱模式,we 开头是规划模式,差异肉眼可见,

但补丁能治不代表病好了, 当前最强开源 Agent 模型有个真实软肋:能力高度绑定特定脚手架,换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91,

根本解法是模型自己对更丰富的工具面具备鲁棒性,不是每次靠用户帮它找锚点,

当然不是DeepSeek的模型菜,别一上来就把整套工具箱全放出来,先给两个工具上手再说
