被骂了整整两个版本的 Gemini Flash,这次居然真的把场子救回来了。也算是把 Gemini 3.6 丢的脸全挣回来了哈哈,
@OfficialLoganK Kilpatrick 和 @sundarpichai 昨天都在发推庆祝:Gemini 3.7 是 Google 史上增长最快的一次模型发布。
讲真这次还真不是官方自嗨, 回看前代,3.5 和 3.6 被开发者喷得有多惨,这一代的反弹就有多凶,之前很多人骂它为了省 token 把脑子省没了,写代码动不动就崩,前端生成稀烂,结果距离 3.6 发版仅仅 3 周,Google 就搞出了一场教科书级的救场。
官方直接把 3.7 Flash 定位成了"迄今最智能的工作马(workhorse)模型",最狠的提升全砍在实际干活的刀刃上:
第一是长周期工程与 Agent 容错。DeepSWE 评分从 48.6% 一口气拉到 65.3%,遇到编译报错不再瞎改,而是真会看测试反馈去自我纠错;WebDev Arena 直接干到 1588 分,单 Prompt 搓出能玩的网页终于不再是 PPT 忽悠了。
第二是价格和速度直接掀桌,入门价打到 0.75 刀输入加 3.75 刀输出每百万 token,直接砍半,同时还能保持 340+ tok/s 的极高吞吐和 1M 上下文。
这件事最值得琢磨的信号是:大模型竞争的胜负手,正在从比拼旗舰天花板,转向比拼牛马及格线。
以前做 Agent 系统大家只能咬牙上昂贵的前沿旗舰,因为小模型动不动跑偏死循环;
当一个几毛钱的 Flash 级别模型在代码闭环上能咬住顶级模型时,整个应用层的算力成本结构被瞬间重写了。
虽然顶级前沿模型负责探索能力的边界,但真正让成千上万个 Agent 在后台 24 小时跑出商业闭环的,永远是这种又便宜又扛造的重型工作马模型