
下面比较的是同一条主线:
gemini-3.5-flashgemini-3.6-flashgemini-3.7-flash
不包括 3.5 Flash-Lite、3.5 Flash Cyber,也不是比较 Pro 系列。
一句话结论
从官方公布的变化看,可以把它们理解为:
- 3.5:把 Flash 正式升级为“编程+Agent 主力模型”
- 3.6:重点解决 3.5 啰嗦、耗 token、工具调用绕路的问题
- 3.7:重点提高复杂任务的首次成功率、指令遵循和长流程稳定性
所以,3.5→3.6 主要是效率升级,3.6→3.7 主要是质量升级。
核心差异总表
| 项目 | Gemini 3.5 Flash | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|---|
| 发布时间 | 2026年5月19日 | 2026年7月21日 | 2026年8月13日 |
| 官方定位 | Agent 与编程能力的新基线 | 更高效、更少冗余的生产级主力 | 当前最强 Flash,主攻复杂编程与 Agent |
| 主要升级 | 子 Agent、长流程任务、多轮思考保留、复杂编码 | 减少输出 token、减少推理步骤和工具调用、降低无关修改 | 提高首次代码正确率、复杂调试、网页还原、文档推理、工作流执行 |
| 编程特点 | 能承担长时间、多步骤编码 | 更少乱改、更少执行循环 | 更容易一次改对,复杂问题解决能力明显增强 |
| Agent 特点 | 支持子 Agent 和长周期任务 | Agent 执行更省 token、更少绕路 | 多步骤规划、工具调用、异常恢复更稳 |
| 网页/UI | 强化了交互网页与图形生成 | 在 3.5 基础上提高效率 | 明显强化截图还原、设计稿一致性、完整应用生成 |
| 文档与知识工作 | 已具备复杂文档处理能力 | 图表、数据、报告分析更强 | PDF、金融、法律、生物、企业流程准确率进一步提升 |
| 默认思考档位 | medium | medium | medium |
| 可选思考档位 | minimal/low/medium/high | minimal/low/medium/high | low/medium/high,不支持 minimal |
| 输入上下文 | 1,048,576 tokens | 1,048,576 tokens | 1,048,576 tokens |
| 最大输出 | 65,536 tokens | 65,536 tokens | 65,536 tokens |
| 当前标准 API 价格 | 输入 $1.50、输出 $9.00 | 输入 $0.75、输出 $3.75,推广期 | 输入 $0.75、输出 $3.75,推广期 |
| 当前状态 | Legacy,旧代模型 | Previous generation | Latest,当前推荐 |
发布时间及官方定位来自 Google 的三次发布公告;当前模型目录已把 3.7 定义为最新 Flash、3.6 定义为上一代、3.5 定义为旧代模型。(blog.google)
共同点其实很多
这三代并不是每次都更换上下文架构或增加新模态。按照当前 API 规格,它们都支持:
- 文本、图片、视频、音频、PDF 输入
- 文本输出
- 约 100 万 token 输入上下文
- 65,536 token 最大输出
- Function Calling
- Code Execution
- Computer Use
- File Search
- Google Search / Maps Grounding
- Structured Output
- URL Context
- Context Caching
因此,3.7 的核心价值不是上下文更大,也不是突然多了新工具,而是同样工具条件下,模型规划、编码、执行和纠错能力更强。(Google AI for Developers)
3.5 Flash:能力底座升级
3.5 是这一轮升级里最像“新一代基础版本”的一次。
它首次把 Flash 明确定位为:
在较高速度下承担复杂编程、子 Agent、长周期任务和多步骤工具执行。
主要更新包括:
1. 子 Agent 与长流程任务
3.5 强化了:
- 子 Agent 部署
- 多步骤工作流
- 长时间任务
- 反复编码、测试、修改
- 多个方案并行探索
这意味着 Flash 不再只是快速回答和简单生成,而是开始适合 Antigravity 这种持续运行的编码 Agent。(Google AI for Developers)
2. 多轮思考保留
3.5 引入或强化了 Thought Preservation:在多轮调试、代码重构过程中,可以保留前面回合的推理上下文。
例如第一轮分析数据库结构,第二轮改后端,第三轮修前端时,不必每次完全重新理解整个问题。(Google AI for Developers)
3. 思考档位改为默认 medium
3.5 将默认思考强度从早期 Gemini 3 Preview 的 high 调整为 medium,目的是在质量、延迟和成本之间取得平衡,同时保留:
minimallowmediumhigh
四档控制。(Google AI for Developers)
3.5 的主要问题
3.5 虽然已经很强,但开发者反馈主要集中在:
- 有时输出过长
- 推理步骤过多
- 工具调用过多
- Agent 循环次数偏多
- 修改代码时偶尔扩大修改范围
- 实际任务 token 成本较高
所以 3.6 的升级方向非常明确:不是先追求更聪明,而是先让它别绕路。
3.6 Flash:效率、稳定性和成本升级
3.6 是直接根据 3.5 的生产使用反馈改出来的版本。
核心变化一:少用 token
Google 公布的数据是:
- 相比 3.5,3.6 平均减少约 17% 输出 token
- 在部分软件工程任务中,token 减少幅度最高可达到约 65%
- 完成多步骤工作流时,推理步骤和工具调用次数更少
这不是简单地让回答变短,而是减少:
- 重复分析
- 无意义解释
- 反复调用同一个工具
- Agent 来回尝试
- 不必要的代码修改循环
核心变化二:减少无关代码修改
Google 特别提到,3.6 在编程任务中:
- 精度更高
- 不需要的代码修改更少
- 执行循环更少
- 代码迁移和多 Agent 编排更稳
这对于你经常强调的:
不要乱改、不要扩大范围、只修改指定模块
3.6 相比 3.5 是一次很实际的改善。(blog.google)
核心变化三:知识工作和电脑操作提高
3.6 还强化了:
- PDF、报告、图表解析
- 财务数据和访谈记录分析
- 报告起草
- Computer Use
- 空间和多模态理解
- 机器学习研究任务
Google 公布的 3.5→3.6 相邻版本结果
| 测试项目 | 3.5 Flash | 3.6 Flash |
|---|---|---|
| DeepSWE | 37% | 49% |
| MLE Bench | 49.7% | 63.9% |
| OSWorld-Verified | 78.4% | 83.0% |
| GDPval-AA v2 | 1349 | 1421 |
这些数据说明 3.6 并非只是“压缩回答”,它在编程、电脑操作和知识工作方面也有实际提升。(blog.google)
3.7 Flash:复杂任务成功率升级
3.7 与 3.6 只间隔了 23 天,但升级重点和 3.6 不一样。
Google 对 3.7 的定位是:
当前最强的 Flash 编程与 Agent 主力模型。
它主要强化的是:更难的问题能不能一次做对。
核心变化一:复杂调试和问题解决
3.7 对这些任务提升最明显:
- 定位复杂 Bug
- 跨文件修复
- Issue resolution
- 生产代码生成
- 长周期软件工程任务
- 失败后的重新规划
- 减少 Agent 陷入无效循环
Google 表示,3.7 在真实软件工程任务中提高了首次代码准确率,减少失败的 Agent 循环。(Google AI for Developers)
核心变化二:网页和设计稿还原
这是 3.7 很重要的一项升级。
它更擅长:
- 根据截图生成网页
- 根据 Figma 或设计系统实现页面
- 保持布局、间距和视觉风格
- 检查现有代码是否与设计稿 1:1 对应
- 用更少提示生成完整功能页面
3.7 比 3.5、3.6 更符合这个场景。Google 官方直接强调了 design adherence 和 1:1 design parity。(Google AI for Developers)
核心变化三:指令遵循和异常处理
3.7 相比 3.6:
- 更能遵守具体修改范围
- 遇到障碍时更会调整方案
- 需要时会识别意图不明确之处
- 多步骤计划更严谨
- 工具调用更有纪律
- 减少人工监督和重复重试
因此,3.7 对“只改指定文件”“不得新增无关功能”“保持现有结构”这类严格约束,理论上会比前两代更可靠。(blog.google)
核心变化四:复杂文档和企业流程
3.7 进一步增强了:
- PDF 深度理解
- 金融、法律、生物科学知识任务
- 企业自动化流程
- 多技能工作流
- Google Workspace 工具调用
例如读取年报、提取数据、生成图表和汇总报告,或者跨文件整理信息并更新状态文档。(blog.google)
Google 公布的 3.6→3.7 相邻版本结果
| 测试项目 | 3.6 Flash | 3.7 Flash |
|---|---|---|
| FrontierCode 1.1 | 34.4% | 43.6% |
| DeepSWE v1.1 | 49.0% | 65.3% |
| WebDev Arena Elo | 1538 | 1588 |
| GDP.pdf | 22.0% | 34.0% |
| AutomationBench | 17.0% | 30.4% |
这些提升集中在:
- 软件工程
- 网页开发
- PDF 文档
- 企业自动化
而不是普通闲聊。(blog.google)
需要注意:Google 两次发布使用的是相邻版本对比,部分测试版本和评测环境可能不同,因此不能把所有数字机械拼接成一个完全统一的三代排行榜。
思考模式的一个重要区别
三代默认都是 medium,但支持档位不完全相同:
| 模型 | 支持的思考档位 |
|---|---|
| 3.5 Flash | minimal、low、medium、high |
| 3.6 Flash | minimal、low、medium、high |
| 3.7 Flash | low、medium、high |
3.7 不支持 minimal。
这意味着:
- 极简单、极低延迟的小任务,3.6 可以使用
minimal - 3.7 最低只能使用
low - 复杂编程默认使用
medium - 架构设计、疑难 Bug、跨模块重构可以使用
high
价格差别
截至 2026年8月22日,标准 Gemini Developer API 每百万 token 价格是:
| 模型 | 输入 | 输出,包含思考 token |
|---|---|---|
| 3.5 Flash | $1.50 | $9.00 |
| 3.6 Flash | $0.75 | $3.75 |
| 3.7 Flash | $0.75 | $3.75 |
3.6 和 3.7 的价格属于推广价,有效至 2026年12月31日。从 2027年1月1日起,两者计划恢复为:
- 输入:$1.50 / 1M tokens
- 输出:$7.50 / 1M tokens
3.6 刚发布时原价就是 $1.50/$7.50;3.7 发布后,Google 把 3.7 的推广价也同步应用到了 3.6。(Google AI for Developers)
3.7 是否一定比 3.6 更快?
不一定。
3.6 的重点是:
- 少输出
- 少思考步骤
- 少工具调用
- 低延迟、低成本
3.7 的官方描述则是:
- 思考更认真
- 多步骤规划投入更多
- 工具执行更严谨
- 更重视首次成功率
所以单次请求上,3.7 在困难任务中可能比 3.6 思考更久;Google目前没有公布一个可以概括所有场景的“3.7 比 3.6 快多少”的数字。
但从完整工作流看,3.7 因为减少返工和重试,最终完成任务的总时间反而可能更短。这是根据官方行为描述作出的实际使用推断。(blog.google)
对你使用 Antigravity 的实际建议
直接选 3.7 的任务
这些任务优先使用 3.7 Flash + medium:
- PLM 跨文件开发
- Vue3 页面按原型还原
- Python 后端联调
- 复杂 Bug 排查
- 数据库结构迁移
- 上游模板增量合并
- 多 Agent 协作
- 长时间连续编码
- 严格限制修改范围
- 根据截图或设计稿复刻 UI
Google现在也已经将 3.7 设置为 Antigravity Agent 和 Managed Agents 的默认模型。(Google AI for Developers)