截至 2026 年 8 月 25 日,大多数新的 Gemini Developer API 文本任务可以先从 gemini-3.7-flash 开始。它是当前稳定版(GA)的最新 Flash,Google 将它定位为面向编码、代理式工作流和可靠多步执行的主力模型。若任务是分类、抽取、翻译、文档分流等高吞吐工作,gemini-3.5-flash-lite 更贴近低延迟和成本优先的目标。gemini-3.1-pro-preview 仍有验证价值,但它是 Preview,不应只因名称里有 Pro 就直接成为生产默认值。
这篇对比只讨论 Gemini Developer API 中“可接收文本、图片、视频、音频或 PDF,并输出文本”的通用模型。图像生成、Live 实时语音、TTS、嵌入模型,以及 Gemini 网页或 App 的订阅套餐,是不同的产品和计费面。
先看结论:按任务风险选,而不是按名字选
| 你的工作负载 | 建议先测的模型 | 为什么 | 需要留意 |
|---|---|---|---|
| 新应用、编码助手、复杂多步工具调用 | gemini-3.7-flash | 当前最新 GA Flash,质量、速度、工具能力与生命周期较均衡 | 默认 thinking 为 medium;复杂请求的输出 token 仍会影响延迟和账单 |
| 已在 3.6 Flash 上稳定运行 | gemini-3.6-flash,同时评估 3.7 | 同为 GA,且 2026 年底前标准促销价相同 | 新功能开发不必主动锁死旧一代;应保留可回退配置 |
| 大批量分类、结构化抽取、翻译、轻量子任务 | gemini-3.5-flash-lite | 低延迟、低成本,官方明确面向高吞吐与简单自动化 | “Lite”不是任何任务都更省;失败重试和过度 thinking 会吞掉单价优势 |
| 已有 3.1 Flash-Lite,成本极敏感 | gemini-3.1-flash-lite | 当前标准文本输入/输出单价更低 | 它是更早一代,官方退役页已把 3.5 Flash-Lite 列为替代方向,需计划迁移 |
| 高难推理、复杂代码或自定义工具组合 | gemini-3.1-pro-preview 与 3.7 Flash 做同题对照 | Pro Preview 仍针对复杂推理、软件工程和精确工具使用 | Preview 会变化;没有免费付费层;长 prompt 价格会跃升 |
| 仍在 2.5 Pro / Flash / Flash-Lite | 立即建立迁移测试 | 官方列出的最早 shutdown date 是 2026-10-16 | 不要等生产请求报错才更换 model ID |
如果只能先选一个,选 gemini-3.7-flash。如果能维护两级路由,让 Flash-Lite 处理边界清晰的轻任务,把失败、歧义大或步骤多的请求升级到 3.7 Flash,通常比“所有请求都走最强型号”更容易控制成本。

当前文本输出主线到底有哪些模型
Google 的当前模型总览把 3.7 Flash、3.6 Flash、3.5 Flash、3.5 Flash-Lite 和 3.1 Flash-Lite 列为稳定版;3.1 Pro 与 3 Flash 仍标记为 Preview。这里的版本状态比昵称重要,因为真正发 API 请求时需要的是准确 model ID。
Gemini 3.7 Flash:新项目的合理默认值
gemini-3.7-flash 在 2026 年 8 月成为 GA。官方模型页列出 1,048,576 输入 token 和 65,536 输出 token 上限,支持缓存、代码执行、函数调用、结构化输出、搜索 grounding、URL context 等常用能力。Google 特别强调编码、代理式执行和可靠多步任务。
这不等于它对所有私有数据都必然胜出。更准确的用法是:把它设为候选默认值,再用真实任务验证首次成功率、工具调用正确率、P95 延迟与每个成功结果的总 token 成本。
Gemini 3.6 Flash:可用的稳定回退,而非新项目终点
gemini-3.6-flash 也是 GA,能力面与 3.7 接近,并且两者在 2026 年底前使用相同的标准促销价。已有稳定系统不必为了版本号立刻切换,但应在同一组测试样本上比较 3.7,并把模型 ID 放进配置而不是写死在业务逻辑中。
当 3.7 在某类 prompt 或工具链上出现回归时,3.6 是清晰的稳定回退。反过来,如果 3.7 在成功率相同的情况下减少重试或输出冗余,即使单次标价相同,它的每个成功任务成本也可能更低。
Gemini 3.5 Flash:仍是 GA,但已不是优先起点
gemini-3.5-flash 仍为稳定版,也有 1M 输入上下文和 65k 输出上限。不过当前总览把它描述为 legacy Flash;其标准价格还高于 3.7/3.6 的年内促销价。它更适合作为现有系统的兼容基线或回退候选,而不是新接入的第一选择。
Flash-Lite:把便宜留给可定义的任务
gemini-3.5-flash-lite 不是“低配聊天模型”的简单同义词。官方模型页把它定位为低延迟、高吞吐的多模态模型,适合文档解析、简单数据抽取和子代理任务。它同样支持 1,048,576 输入和 65,536 输出 token,但共享上下文规格不代表共享推理质量。
Flash-Lite 最适合有明确完成标准的任务,例如:输出必须符合 JSON Schema、分类标签集合固定、抽取字段可校验、翻译结果可抽样复核。对于开放式架构设计、长链路调试或多工具计划,错误重试一次就可能抵消省下的 token 单价。
gemini-3.1-flash-lite 目前价格更低,旧系统也可以继续使用,但它的生命周期短于 3.5 Flash-Lite。新项目若预计运行数月以上,应该把迁移成本纳入选择,而不是只比较今天的输入单价。
Gemini 3.1 Pro Preview:用验证结果换取承担 Preview 的理由
gemini-3.1-pro-preview 面向复杂问题、软件工程和精确工具使用。它也支持 1M 输入与 65k 输出,并提供单独的 gemini-3.1-pro-preview-customtools 端点,偏向 bash 与自定义工具混合的代理工作流。
关键限制在名称最后:Preview。它可能在成为稳定版之前发生行为、限额或合同变化。合理策略不是全面切到 Pro,而是挑出 Flash 最难完成、失败代价又高的任务,与 3.7 Flash 做盲测;只有质量增益能够覆盖更高价格、延迟和变更风险时,才把这些任务路由给 Pro Preview。
2026 年 8 月的标准 API 价格
下表来自 Gemini Developer API 官方价格页,单位为美元/每百万 tokens,适用于标准付费推理。输出价包含 thinking tokens;Batch、Flex 和 Priority 有另一组价格,不能直接混用。
| 模型 | 标准输入 | 标准输出(含 thinking) | 当前状态 |
|---|---|---|---|
| Gemini 3.7 Flash | $0.75 | $3.75 | GA;促销价至 2026-12-31,之后计划为 $1.50 / $7.50 |
| Gemini 3.6 Flash | $0.75 | $3.75 | GA;同一促销期限 |
| Gemini 3.5 Flash | $1.50 | $9.00 | GA,旧一代 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | GA |
| Gemini 3.1 Flash-Lite | $0.25(文本/图片/视频) | $1.50 | GA,较早一代 |
| Gemini 3.1 Pro Preview | $2.00(prompt ≤200k);$4.00(>200k) | $12.00;$18.00 | Preview |
价格表不能单独决定模型。实际成本更接近:
每个成功任务成本 = 输入 + thinking/输出 + 工具调用相关消耗 + 重试 + 缓存存储
例如,一个 $0.30 输入价的模型如果经常输出过长、调用错误工具或需要重试,可能比一次完成的 $0.75 模型更贵。对生产系统,至少同时记录成功率、P95 延迟、输入 token、输出/思考 token 与重试次数。
免费层也要单独理解。官方价格页说明,符合条件的模型可有免费输入和输出,但模型、项目与地区的可用性和限额会变化;免费层提交的内容可能用于改进 Google 产品,而付费层页面写明不会用于此目的。敏感或生产数据不应只因“免费”就直接进入未评估的利用面。
thinking level 会同时改变质量、延迟和账单
官方 thinking 文档显示,不同模型的默认与可选级别并不完全一样:3.7 Flash 默认 medium,支持 low、medium、high;3.6 和 3.5 Flash-Lite 还支持 minimal;3.1 Pro Preview 默认 high。
这意味着比较时必须固定 thinking 配置。否则你可能不是在比较模型,而是在比较不同的推理预算。低延迟聊天或简单抽取可先从 low/minimal 验证;复杂编码、数学和多工具任务可提高级别,但要同时观察 thinking tokens 和超时率。不要继续沿用已经废弃的 temperature、top_p、top_k 作为 3.7 的主要调节手段;3.7 迁移指南要求移除这些参数并使用 thinking_level。

从 2.5 或更早版本迁移时,别只改字符串
官方退役时间表列出:Gemini 2.0 Flash 与 Flash-Lite 已在 2026 年 6 月 1 日关闭;2.5 Pro、2.5 Flash、2.5 Flash-Lite 的最早 shutdown date 为 2026 年 10 月 16 日。Google 也说明这些是最早可能日期,确切通知仍可能更新。
一次安全迁移至少包含以下动作:
- 盘点代码、环境变量、队列任务和配置中心里的所有 model ID。
- 用固定样本比较旧模型与目标模型,覆盖正常输入、长上下文、工具失败、结构化输出和安全拒绝。
- 检查 3.x 的参数、thought signature、函数响应格式与多轮状态管理要求。
- 把新旧模型放进可切换配置,先灰度,再扩大流量。
- 上线后按“每个成功任务”观察质量、延迟和成本,而不是只看单次请求价格。
如果今天开始新项目,gemini-3.7-flash 是最省解释成本的默认值;如果工作负载高度重复且可校验,增加 gemini-3.5-flash-lite 作为廉价路由;如果少数复杂任务仍达不到要求,再用同题测试证明 gemini-3.1-pro-preview 的价值。这样的选择不是追逐型号,而是把能力、成本与版本风险放到同一个可回退的系统里。



