Gemini 3.7 Flash 发布:DeepSWE 评分大幅提升,价格减半

AYi · @AYi_AInotes · X·2026-08-22 14:47·1天前
AI 导读

Google 发布 Gemini 3.7 Flash,定位“迄今最智能的工作马模型”,距 3.6 发版仅 3 周。其 DeepSWE 评分从 48.6% 升至 65.3%,WebDev Arena 达 1588 分,入门价降至 0.75 美元/百万输入 token,输出 3.75 美元,支持 1M 上下文与 340+ tok/s 吞吐。

AYi@AYi_AInotes
47AI 编辑部评分,满分 100

Gemini 3.7 Flash 发布:DeepSWE 评分大幅提升,价格减半

2026-08-22 14:47· 1天前
AI 导读

Google 发布 Gemini 3.7 Flash,定位“迄今最智能的工作马模型”,距 3.6 发版仅 3 周。其 DeepSWE 评分从 48.6% 升至 65.3%,WebDev Arena 达 1588 分,入门价降至 0.75 美元/百万输入 token,输出 3.75 美元,支持 1M 上下文与 340+ tok/s 吞吐。

被骂了整整两个版本的 Gemini Flash,这次居然真的把场子救回来了。也算是把 Gemini 3.6 丢的脸全挣回来了哈哈,

@OfficialLoganK Kilpatrick 和 @sundarpichai 昨天都在发推庆祝:Gemini 3.7 是 Google 史上增长最快的一次模型发布。

讲真这次还真不是官方自嗨, 回看前代,3.5 和 3.6 被开发者喷得有多惨,这一代的反弹就有多凶,之前很多人骂它为了省 token 把脑子省没了,写代码动不动就崩,前端生成稀烂,结果距离 3.6 发版仅仅 3 周,Google 就搞出了一场教科书级的救场。

官方直接把 3.7 Flash 定位成了"迄今最智能的工作马(workhorse)模型",最狠的提升全砍在实际干活的刀刃上:

第一是长周期工程与 Agent 容错。DeepSWE 评分从 48.6% 一口气拉到 65.3%,遇到编译报错不再瞎改,而是真会看测试反馈去自我纠错;WebDev Arena 直接干到 1588 分,单 Prompt 搓出能玩的网页终于不再是 PPT 忽悠了。

第二是价格和速度直接掀桌,入门价打到 0.75 刀输入加 3.75 刀输出每百万 token,直接砍半,同时还能保持 340+ tok/s 的极高吞吐和 1M 上下文。

这件事最值得琢磨的信号是:大模型竞争的胜负手,正在从比拼旗舰天花板,转向比拼牛马及格线。

以前做 Agent 系统大家只能咬牙上昂贵的前沿旗舰,因为小模型动不动跑偏死循环;

当一个几毛钱的 Flash 级别模型在代码闭环上能咬住顶级模型时,整个应用层的算力成本结构被瞬间重写了。

虽然顶级前沿模型负责探索能力的边界,但真正让成千上万个 Agent 在后台 24 小时跑出商业闭环的,永远是这种又便宜又扛造的重型工作马模型

Logan KilpatrickGemini 3.7 is our fastest growing model launch to date, amazing to see the reception!!!