# DeepSeek V4 Flash自验证逆袭Claude Fable 5

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-08-18 13:03
- AIHOT 分数：42
- AIHOT 链接：https://aihot.virxact.com/items/cmsy7umqu0mgdroz08du1s9pk
- 原文链接：https://x.com/AYi_AInotes/status/2089578957293125797

## AI 摘要

Stanford团队用DeepSeek V4 Flash采样5个答案并让同一模型自评打分，在Terminal-Bench 2.1上准确率从79%提升至88%，超越Claude Fable 5且成本仅为对方1/11。该方法验证了test-time scaling的潜力，框架已开源，可复现。

## 正文

Stanford这帮人可能找到了今年最狠的Claude、ChatGPT平替路线,我直接把手里所有闭源模型订阅全停了,这可能是今年开源AI最狠的一次逆袭。。

Stanford的人用DeepSeek V4 Flash,
同一个任务生成5个答案,
再让同一个模型自己当裁判打分,
挑最高分的那个交卷。

Terminal-Bench 2.1,
79%直接干到88%,
超过了Claude最新的Fable 5,
成本只有对方的十一分之一。

全网都在喊开源吊打闭源,
但90%的人没看懂真正的信号。

生成端早就卷到头了。
真正拉开差距的是验证。

以前大家拼模型参数,
拼训练数据,
拼基准测试高0.5。
现在发现,
同一个便宜模型多跑几次,
再自己挑出最好的,
就能干翻贵11倍的旗舰。

这就是test-time scaling的真正玩法。
模型不用做大,
推理时多花一点算力,
用生成加验证换效果。

验证本身还能继续缩放,
更细的评分标准,
多验证几轮,
把评价维度拆得更碎。

框架已经开源,
任何人都能拿DeepSeek V4 Flash直接复现。

模型是引擎,
验证才是刹车和方向盘。
引擎够猛就行,
没有刹车和方向盘谁也不敢开快。

我觉得接下来所有agent框架都会默认加上自验证这一层吧 hhh

### 引用推文

> Jacky Kwok：Scaling self-verification with DeepSeek V4 Flash beats Claude Fable 5 on Terminal-Bench 2.1, while being 11x cheaper 💰 As open-source models become more capabl...
