DeepSeek V4 Flash自验证逆袭Claude Fable 5

AYi · @AYi_AInotes · X·2026-08-18 13:03·5小时前
AI 导读

Stanford团队用DeepSeek V4 Flash采样5个答案并让同一模型自评打分,在Terminal-Bench 2.1上准确率从79%提升至88%,超越Claude Fable 5且成本仅为对方1/11。该方法验证了test-time scaling的潜力,框架已开源,可复现。

AYi@AYi_AInotes
42AI 编辑部评分,满分 100

DeepSeek V4 Flash自验证逆袭Claude Fable 5

2026-08-18 13:03· 5小时前
AI 导读

Stanford团队用DeepSeek V4 Flash采样5个答案并让同一模型自评打分,在Terminal-Bench 2.1上准确率从79%提升至88%,超越Claude Fable 5且成本仅为对方1/11。该方法验证了test-time scaling的潜力,框架已开源,可复现。

Stanford这帮人可能找到了今年最狠的Claude、ChatGPT平替路线,我直接把手里所有闭源模型订阅全停了,这可能是今年开源AI最狠的一次逆袭。。

Stanford的人用DeepSeek V4 Flash, 同一个任务生成5个答案, 再让同一个模型自己当裁判打分, 挑最高分的那个交卷。

Terminal-Bench 2.1, 79%直接干到88%, 超过了Claude最新的Fable 5, 成本只有对方的十一分之一。

全网都在喊开源吊打闭源, 但90%的人没看懂真正的信号。

生成端早就卷到头了。 真正拉开差距的是验证。

以前大家拼模型参数, 拼训练数据, 拼基准测试高0.5。 现在发现, 同一个便宜模型多跑几次, 再自己挑出最好的, 就能干翻贵11倍的旗舰。

这就是test-time scaling的真正玩法。 模型不用做大, 推理时多花一点算力, 用生成加验证换效果。

验证本身还能继续缩放, 更细的评分标准, 多验证几轮, 把评价维度拆得更碎。

框架已经开源, 任何人都能拿DeepSeek V4 Flash直接复现。

模型是引擎, 验证才是刹车和方向盘。 引擎够猛就行, 没有刹车和方向盘谁也不敢开快。

我觉得接下来所有agent框架都会默认加上自验证这一层吧 hhh

Jacky KwokScaling self-verification with DeepSeek V4 Flash beats Claude Fable 5 on Terminal-Bench 2.1, while being 11x cheaper 💰 As open-source models become more capabl...