Gemini 3.7 Flash:主力档三周一迭代,价格砍半
Gemini 3.7 Flash 在 3.6 Flash 发布仅三周后到来,编码、网页开发与文档密集型知识工作全面提升,而每百万 token 的首发价格是上一代的一半。所有对比都是同族前一版,是这类公告里少见的可比口径。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
三周一代,价格砍半
Gemini 3.7 Flash 定位是「主力档」(workhorse)模型,面向编码与智能体。它距离 3.6 Flash 只有 三周,官方说法是「开发者反馈加上算法改进」的直接结果。
首发价格是 3.6 Flash 每百万 token 成本的 一半。
提升幅度写成了同族对照
这份公告有一点值得单独称赞:每一个数字都是和自家前一版比的,而不是和一个精心挑选的竞品比。这让它成为少数可以直接读的发布公告。
- FrontierCode 1.1 Main:43.6%,对 34.4%
- DeepSWE v1.1:65.3%,对 49.0%
- WebDev Arena Elo:1588,对 1538
- GDP.pdf:34.0%,对 22.0%(复杂文档处理)
- AutomationBench:30.4%,对 17.0%(真实业务流程)
其中 DeepSWE 从 49.0% 到 65.3%、AutomationBench 从 17.0% 到 30.4%,都接近翻倍——三周之内。
值得注意的是提升的方向
赢面集中在调试与问题解决、一次通过的代码正确率、以及生成可直接投产的代码。网页开发这一项它强调的是「更少的提示词内生成功能完整的应用」,UI 生成则强调对参考输入(截图、图片、完整设计系统)的设计一致性。
换句话说,这一版优化的不是「能不能做」,而是做对的比例和来回次数。对跑智能体循环的人,后者直接就是成本。
一个该保持清醒的地方
「首发价格」四个字是有分量的。这类定价通常有窗口期,公告本身没有说明窗口多长、之后回到什么水平。把它当作长期成本模型的输入之前,先确认正式定价。
同样地,上面每一组数字都来自厂商自己的评测口径。它们内部一致、可比,但这把尺子只量过自家两代模型——按本站《模型与输出评估》的判据,那是可比而非可横比。
为什么是现在
为什么重要
主力档模型三周一迭代且价格砍半,说明这一档的竞争已经从「能不能做」转到「做对的比例和单位成本」——而这两个恰好是跑智能体循环时唯一重要的数。
背景
技术背景
Gemini 3.7 Flash 为 Flash 系列的主力档模型,面向编码与智能体场景。公告给出的对照全部是 3.6 Flash:FrontierCode 1.1 Main 43.6% vs 34.4%、DeepSWE v1.1 65.3% vs 49.0%、WebDev Arena Elo 1588 vs 1538、GDP.pdf 34.0% vs 22.0%、AutomationBench 30.4% vs 17.0%。
关注人群
谁该关注
下一步
学习路径
- 先确认 introductory 价格的窗口期与之后的正式定价,再把它写进成本模型
- 把「一次通过率」和「来回次数」当成比总分更有用的指标
- 在自己的任务上跑一次同族对照,不要直接采信厂商表格里的相对幅度
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- introductory 定价的窗口期有多长,正式价格是多少?
- 三周一次的迭代节奏下,提示词与评测需要多久重跑一遍?
- 这些数字在厂商评测之外的第三方基准上能复现多少?
来源参考