内部代号 Skimaki,据称在自家 Jetski 平台的对比测试里赢过 Anthropic Opus——消息来自《华尔街日报》的知情人士,尚未获官方证实。
这条消息里最值得注意的不是「谷歌又要发模型」,而是它选了哪条产品线来打这一仗。Flash 在 Gemini 家族里一直是便宜、快、够用的那一档,负责走量而不是冲榜。把编码这个最挑剔、最吃钱的场景压到 Flash 上,本身就是一个态度。
过去一年多,编码是唯一一个用户愿意为「更贵一点」持续付费的模型场景——一次调用值多少钱,取决于它能不能一次把补丁写对。这也是 OpenAI 和 Anthropic 拉开身位的地方:前者靠 Codex 一路推工程化的 agent 循环,后者靠 Opus 在复杂重构上的口碑吃住了一批重度用户。谷歌的模型能力并不弱,但在开发者心智里始终隔着一层。
用 Flash 而不是 Pro 来补这一课,意味着谷歌想绕开正面比拼「谁的最强模型更强」,改成比「同样的活,谁的单价更低」。开发者场景对成本极其敏感——一个 agent 跑一轮任务可能烧掉几十次调用,单价差几倍,月底账单就是另一个量级。如果 3.8 Flash 真能把 Opus 级别的编码体验压进 Flash 的价格带,受冲击的首先是那些按调用量计费的中间层工具。
报道里最有分量的细节,是谷歌在自家 Jetski 开发平台上做的对比测试中,工程师据称更偏好新模型而非 Anthropic 的 Opus。这类内部人类偏好评测比跑分更接近真实体感,但它同时也是最容易被挑选口径的一种结论:测试任务是谁出的、对照组用的是哪个配置、有没有把上下文长度和工具调用能力拉齐,这些都没有公开。
更实际的参考是:偏好测试通常在「短平快的修改任务」上最容易分出胜负,而在需要长时间保持上下文、反复调用工具的长任务上,差距往往会反过来。所以在第三方基准和真实项目里跑过之前,这条结论最多只能读成「谷歌自己认为这次追上来了」,而不是「已经超过」。这也是所有厂商发布前放风的标准姿势。
把时间线摆开会更清楚:Gemini 3.7 Flash 在 8 月 13 日发布,距离 3.6 Flash 只隔了三周;如果 3.8 Flash 本周落地,就是又一个三周。这种迭代密度已经不是传统意义上的「版本发布」,更像是持续交付——每一次都只推动一两个能力维度,然后立刻拿真实用量当测试集。
对使用者来说,这个节奏是双刃的。好处是能力曲线抬得快、价格往下压得也快;代价是任何依赖模型稳定行为的东西都在跟着抖——提示词的边界、工具调用的格式偏好、长任务里的决策风格,都可能在一次小版本里悄悄变化。真正靠模型干活的人,感受到的往往不是「变强了」,而是「上周还好好的流程今天要重调」。
如果你现在的工作流已经绑死在某一家的编码模型上,这轮竞赛短期内不会让你换阵营,但它大概率会先反映在价格和限流策略上——大厂在被追赶的时候,最先动的通常是这两个旋钮。把手上的配置整理清楚,等新一轮价格和额度调整落地时,才好判断到底该不该动。