Stanford这帮人可能找到了今年最狠的Claude、ChatGPT平替路线,我直接把手里所有闭源模型订阅全停了,这可能是今年开源AI最狠的一次逆袭。。
Stanford的人用DeepSeek V4 Flash, 同一个任务生成5个答案, 再让同一个模型自己当裁判打分, 挑最高分的那个交卷。
Terminal-Bench 2.1, 79%直接干到88%, 超过了Claude最新的Fable 5, 成本只有对方的十一分之一。
全网都在喊开源吊打闭源, 但90%的人没看懂真正的信号。
生成端早就卷到头了。 真正拉开差距的是验证。
以前大家拼模型参数, 拼训练数据, 拼基准测试高0.5。 现在发现, 同一个便宜模型多跑几次, 再自己挑出最好的, 就能干翻贵11倍的旗舰。
这就是test-time scaling的真正玩法。 模型不用做大, 推理时多花一点算力, 用生成加验证换效果。
验证本身还能继续缩放, 更细的评分标准, 多验证几轮, 把评价维度拆得更碎。
框架已经开源, 任何人都能拿DeepSeek V4 Flash直接复现。
模型是引擎, 验证才是刹车和方向盘。 引擎够猛就行, 没有刹车和方向盘谁也不敢开快。
我觉得接下来所有agent框架都会默认加上自验证这一层吧 hhh