下面比较的是同一条主线:

  • gemini-3.5-flash
  • gemini-3.6-flash
  • gemini-3.7-flash

不包括 3.5 Flash-Lite、3.5 Flash Cyber,也不是比较 Pro 系列。

一句话结论

从官方公布的变化看,可以把它们理解为:

  • 3.5:把 Flash 正式升级为“编程+Agent 主力模型”
  • 3.6:重点解决 3.5 啰嗦、耗 token、工具调用绕路的问题
  • 3.7:重点提高复杂任务的首次成功率、指令遵循和长流程稳定性

所以,3.5→3.6 主要是效率升级,3.6→3.7 主要是质量升级


核心差异总表

项目Gemini 3.5 FlashGemini 3.6 FlashGemini 3.7 Flash
发布时间2026年5月19日2026年7月21日2026年8月13日
官方定位Agent 与编程能力的新基线更高效、更少冗余的生产级主力当前最强 Flash,主攻复杂编程与 Agent
主要升级子 Agent、长流程任务、多轮思考保留、复杂编码减少输出 token、减少推理步骤和工具调用、降低无关修改提高首次代码正确率、复杂调试、网页还原、文档推理、工作流执行
编程特点能承担长时间、多步骤编码更少乱改、更少执行循环更容易一次改对,复杂问题解决能力明显增强
Agent 特点支持子 Agent 和长周期任务Agent 执行更省 token、更少绕路多步骤规划、工具调用、异常恢复更稳
网页/UI强化了交互网页与图形生成在 3.5 基础上提高效率明显强化截图还原、设计稿一致性、完整应用生成
文档与知识工作已具备复杂文档处理能力图表、数据、报告分析更强PDF、金融、法律、生物、企业流程准确率进一步提升
默认思考档位mediummediummedium
可选思考档位minimal/low/medium/highminimal/low/medium/highlow/medium/high,不支持 minimal
输入上下文1,048,576 tokens1,048,576 tokens1,048,576 tokens
最大输出65,536 tokens65,536 tokens65,536 tokens
当前标准 API 价格输入 $1.50、输出 $9.00输入 $0.75、输出 $3.75,推广期输入 $0.75、输出 $3.75,推广期
当前状态Legacy,旧代模型Previous generationLatest,当前推荐

发布时间及官方定位来自 Google 的三次发布公告;当前模型目录已把 3.7 定义为最新 Flash、3.6 定义为上一代、3.5 定义为旧代模型。(blog.google)


共同点其实很多

这三代并不是每次都更换上下文架构或增加新模态。按照当前 API 规格,它们都支持:

  • 文本、图片、视频、音频、PDF 输入
  • 文本输出
  • 约 100 万 token 输入上下文
  • 65,536 token 最大输出
  • Function Calling
  • Code Execution
  • Computer Use
  • File Search
  • Google Search / Maps Grounding
  • Structured Output
  • URL Context
  • Context Caching

因此,3.7 的核心价值不是上下文更大,也不是突然多了新工具,而是同样工具条件下,模型规划、编码、执行和纠错能力更强。(Google AI for Developers)


3.5 Flash:能力底座升级

3.5 是这一轮升级里最像“新一代基础版本”的一次。

它首次把 Flash 明确定位为:

在较高速度下承担复杂编程、子 Agent、长周期任务和多步骤工具执行。

主要更新包括:

1. 子 Agent 与长流程任务

3.5 强化了:

  • 子 Agent 部署
  • 多步骤工作流
  • 长时间任务
  • 反复编码、测试、修改
  • 多个方案并行探索

这意味着 Flash 不再只是快速回答和简单生成,而是开始适合 Antigravity 这种持续运行的编码 Agent。(Google AI for Developers)

2. 多轮思考保留

3.5 引入或强化了 Thought Preservation:在多轮调试、代码重构过程中,可以保留前面回合的推理上下文。

例如第一轮分析数据库结构,第二轮改后端,第三轮修前端时,不必每次完全重新理解整个问题。(Google AI for Developers)

3. 思考档位改为默认 medium

3.5 将默认思考强度从早期 Gemini 3 Preview 的 high 调整为 medium,目的是在质量、延迟和成本之间取得平衡,同时保留:

  • minimal
  • low
  • medium
  • high

四档控制。(Google AI for Developers)

3.5 的主要问题

3.5 虽然已经很强,但开发者反馈主要集中在:

  • 有时输出过长
  • 推理步骤过多
  • 工具调用过多
  • Agent 循环次数偏多
  • 修改代码时偶尔扩大修改范围
  • 实际任务 token 成本较高

所以 3.6 的升级方向非常明确:不是先追求更聪明,而是先让它别绕路。


3.6 Flash:效率、稳定性和成本升级

3.6 是直接根据 3.5 的生产使用反馈改出来的版本。

核心变化一:少用 token

Google 公布的数据是:

  • 相比 3.5,3.6 平均减少约 17% 输出 token
  • 在部分软件工程任务中,token 减少幅度最高可达到约 65%
  • 完成多步骤工作流时,推理步骤和工具调用次数更少

这不是简单地让回答变短,而是减少:

  • 重复分析
  • 无意义解释
  • 反复调用同一个工具
  • Agent 来回尝试
  • 不必要的代码修改循环

(blog.google)

核心变化二:减少无关代码修改

Google 特别提到,3.6 在编程任务中:

  • 精度更高
  • 不需要的代码修改更少
  • 执行循环更少
  • 代码迁移和多 Agent 编排更稳

这对于你经常强调的:

不要乱改、不要扩大范围、只修改指定模块

3.6 相比 3.5 是一次很实际的改善。(blog.google)

核心变化三:知识工作和电脑操作提高

3.6 还强化了:

  • PDF、报告、图表解析
  • 财务数据和访谈记录分析
  • 报告起草
  • Computer Use
  • 空间和多模态理解
  • 机器学习研究任务

Google 公布的 3.5→3.6 相邻版本结果

测试项目3.5 Flash3.6 Flash
DeepSWE37%49%
MLE Bench49.7%63.9%
OSWorld-Verified78.4%83.0%
GDPval-AA v213491421

这些数据说明 3.6 并非只是“压缩回答”,它在编程、电脑操作和知识工作方面也有实际提升。(blog.google)


3.7 Flash:复杂任务成功率升级

3.7 与 3.6 只间隔了 23 天,但升级重点和 3.6 不一样。

Google 对 3.7 的定位是:

当前最强的 Flash 编程与 Agent 主力模型。

它主要强化的是:更难的问题能不能一次做对。

核心变化一:复杂调试和问题解决

3.7 对这些任务提升最明显:

  • 定位复杂 Bug
  • 跨文件修复
  • Issue resolution
  • 生产代码生成
  • 长周期软件工程任务
  • 失败后的重新规划
  • 减少 Agent 陷入无效循环

Google 表示,3.7 在真实软件工程任务中提高了首次代码准确率,减少失败的 Agent 循环。(Google AI for Developers)

核心变化二:网页和设计稿还原

这是 3.7 很重要的一项升级。

它更擅长:

  • 根据截图生成网页
  • 根据 Figma 或设计系统实现页面
  • 保持布局、间距和视觉风格
  • 检查现有代码是否与设计稿 1:1 对应
  • 用更少提示生成完整功能页面

3.7 比 3.5、3.6 更符合这个场景。Google 官方直接强调了 design adherence1:1 design parity。(Google AI for Developers)

核心变化三:指令遵循和异常处理

3.7 相比 3.6:

  • 更能遵守具体修改范围
  • 遇到障碍时更会调整方案
  • 需要时会识别意图不明确之处
  • 多步骤计划更严谨
  • 工具调用更有纪律
  • 减少人工监督和重复重试

因此,3.7 对“只改指定文件”“不得新增无关功能”“保持现有结构”这类严格约束,理论上会比前两代更可靠。(blog.google)

核心变化四:复杂文档和企业流程

3.7 进一步增强了:

  • PDF 深度理解
  • 金融、法律、生物科学知识任务
  • 企业自动化流程
  • 多技能工作流
  • Google Workspace 工具调用

例如读取年报、提取数据、生成图表和汇总报告,或者跨文件整理信息并更新状态文档。(blog.google)

Google 公布的 3.6→3.7 相邻版本结果

测试项目3.6 Flash3.7 Flash
FrontierCode 1.134.4%43.6%
DeepSWE v1.149.0%65.3%
WebDev Arena Elo15381588
GDP.pdf22.0%34.0%
AutomationBench17.0%30.4%

这些提升集中在:

  • 软件工程
  • 网页开发
  • PDF 文档
  • 企业自动化

而不是普通闲聊。(blog.google)

需要注意:Google 两次发布使用的是相邻版本对比,部分测试版本和评测环境可能不同,因此不能把所有数字机械拼接成一个完全统一的三代排行榜。


思考模式的一个重要区别

三代默认都是 medium,但支持档位不完全相同:

模型支持的思考档位
3.5 Flashminimallowmediumhigh
3.6 Flashminimallowmediumhigh
3.7 Flashlowmediumhigh

3.7 不支持 minimal

这意味着:

  • 极简单、极低延迟的小任务,3.6 可以使用 minimal
  • 3.7 最低只能使用 low
  • 复杂编程默认使用 medium
  • 架构设计、疑难 Bug、跨模块重构可以使用 high

(Google AI for Developers)


价格差别

截至 2026年8月22日,标准 Gemini Developer API 每百万 token 价格是:

模型输入输出,包含思考 token
3.5 Flash$1.50$9.00
3.6 Flash$0.75$3.75
3.7 Flash$0.75$3.75

3.6 和 3.7 的价格属于推广价,有效至 2026年12月31日。从 2027年1月1日起,两者计划恢复为:

  • 输入:$1.50 / 1M tokens
  • 输出:$7.50 / 1M tokens

3.6 刚发布时原价就是 $1.50/$7.50;3.7 发布后,Google 把 3.7 的推广价也同步应用到了 3.6。(Google AI for Developers)


3.7 是否一定比 3.6 更快?

不一定。

3.6 的重点是:

  • 少输出
  • 少思考步骤
  • 少工具调用
  • 低延迟、低成本

3.7 的官方描述则是:

  • 思考更认真
  • 多步骤规划投入更多
  • 工具执行更严谨
  • 更重视首次成功率

所以单次请求上,3.7 在困难任务中可能比 3.6 思考更久;Google目前没有公布一个可以概括所有场景的“3.7 比 3.6 快多少”的数字。

但从完整工作流看,3.7 因为减少返工和重试,最终完成任务的总时间反而可能更短。这是根据官方行为描述作出的实际使用推断。(blog.google)


对你使用 Antigravity 的实际建议

直接选 3.7 的任务

这些任务优先使用 3.7 Flash + medium

  • PLM 跨文件开发
  • Vue3 页面按原型还原
  • Python 后端联调
  • 复杂 Bug 排查
  • 数据库结构迁移
  • 上游模板增量合并
  • 多 Agent 协作
  • 长时间连续编码
  • 严格限制修改范围
  • 根据截图或设计稿复刻 UI

Google现在也已经将 3.7 设置为 Antigravity Agent 和 Managed Agents 的默认模型。(Google AI for Developers)

最后修改:2026 年 08 月 22 日
如果觉得我的文章对你有用,请随意赞赏