AYi@AYi_AInotes
70AI 编辑部评分,满分 100

DeepSeek V4 Pro 能力高度绑定脚手架

2026-08-16 10:47· 1小时前
AI 导读

DeepSeek V4 Pro 能力高度绑定特定脚手架:同一模型同一任务,首轮塞入 25 个工具仅得 91 分,只给 bash 和 str_replace_editor 两个工具则稳定 96-99 分,两阶段锚定(先极简后解锁)连续 98-99 分。

DeepSeek V4 Pro 作为当前最强开源 Agent 模型,有个很离谱的毛病, 或者说是有个真实软肋: 能力高度绑定特定脚手架, 换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91,

也就是说同一个模型,同一套任务,分数能差 7 到 8 分, 区别只在一件事:第一轮你给它用了多少工具,

如果把25 个工具从第一轮全塞进去,91 分,思维链全是 let me,到处乱试, 只给 bash 和 str_replace_editor 两个,稳定 96 到 99, 两阶段锚定--第一轮只给 2 个核心工具,模型真正调用后再解锁完整工具面--连续 98 和 99,

91 和 99,同一个模型,为什么??

V4 Pro 经过强 RL 训练,高能力轨迹被高度条件化在极简接口上,训练时它见的就是这种环境,

你一上来塞 25 个工具加复杂系统提示,等于直接把它推出训练分布,

这时候它除了被干扰了注意力,还相当于被推进了另一个行为模式, 规划者和混乱执行者之间没有过渡,首轮条件直接决定后面整条轨迹,

最讽刺的是官方自己也知道, DeepSeek 跑公开 Agent benchmark 用的就是极简模式,灰测成绩和极简路径高度一致,正式版默认给你 Standard,然后一用就拉,

评测用的脚手架和用户用的脚手架,不是同一个东西,

社区已经出了补丁, dsh-routing-suite 和 dsh-anchored-standard,自动第一轮极简锚定,首次工具调用后挂档解锁, 不想装插件就自己写状态机,第一轮只暴露两个核心工具,模型真调用了再注入剩下的,

最低成本验证:同一个任务,Standard 跑一遍,极简跑一遍,看思维链起手词, let me 开头是混乱模式,we 开头是规划模式,差异肉眼可见,

但补丁能治不代表病好了, 当前最强开源 Agent 模型有个真实软肋:能力高度绑定特定脚手架,换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91,

根本解法是模型自己对更丰富的工具面具备鲁棒性,不是每次靠用户帮它找锚点,

当然不是DeepSeek的模型菜,别一上来就把整套工具箱全放出来,先给两个工具上手再说

来源:AYi · x.com

DeepSeek V4 Pro 能力高度绑定脚手架

AYi · @AYi_AInotes · X·2026-08-16 10:47·1小时前
AI 导读

DeepSeek V4 Pro 能力高度绑定特定脚手架:同一模型同一任务,首轮塞入 25 个工具仅得 91 分,只给 bash 和 str_replace_editor 两个工具则稳定 96-99 分,两阶段锚定(先极简后解锁)连续 98-99 分。

DeepSeek V4 Pro 作为当前最强开源 Agent 模型,有个很离谱的毛病, 或者说是有个真实软肋: 能力高度绑定特定脚手架, 换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91,

也就是说同一个模型,同一套任务,分数能差 7 到 8 分, 区别只在一件事:第一轮你给它用了多少工具,

如果把25 个工具从第一轮全塞进去,91 分,思维链全是 let me,到处乱试, 只给 bash 和 str_replace_editor 两个,稳定 96 到 99, 两阶段锚定--第一轮只给 2 个核心工具,模型真正调用后再解锁完整工具面--连续 98 和 99,

91 和 99,同一个模型,为什么??

V4 Pro 经过强 RL 训练,高能力轨迹被高度条件化在极简接口上,训练时它见的就是这种环境,

你一上来塞 25 个工具加复杂系统提示,等于直接把它推出训练分布,

这时候它除了被干扰了注意力,还相当于被推进了另一个行为模式, 规划者和混乱执行者之间没有过渡,首轮条件直接决定后面整条轨迹,

最讽刺的是官方自己也知道, DeepSeek 跑公开 Agent benchmark 用的就是极简模式,灰测成绩和极简路径高度一致,正式版默认给你 Standard,然后一用就拉,

评测用的脚手架和用户用的脚手架,不是同一个东西,

社区已经出了补丁, dsh-routing-suite 和 dsh-anchored-standard,自动第一轮极简锚定,首次工具调用后挂档解锁, 不想装插件就自己写状态机,第一轮只暴露两个核心工具,模型真调用了再注入剩下的,

最低成本验证:同一个任务,Standard 跑一遍,极简跑一遍,看思维链起手词, let me 开头是混乱模式,we 开头是规划模式,差异肉眼可见,

但补丁能治不代表病好了, 当前最强开源 Agent 模型有个真实软肋:能力高度绑定特定脚手架,换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91,

根本解法是模型自己对更丰富的工具面具备鲁棒性,不是每次靠用户帮它找锚点,

当然不是DeepSeek的模型菜,别一上来就把整套工具箱全放出来,先给两个工具上手再说

来源:AYi· x.com