# 2026 年 Gemini 文本模型怎么选：3.7 Flash、Flash-Lite 与 Pro 对比

> 截至 2026 年 8 月 25 日，梳理 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite、3.1 Pro Preview 等文本输出模型的定位、标准 API 价格、稳定性与迁移期限。

- Source: https://www.aifreeapi.com/zh/posts/gemini-3-0-api
- Language: zh
- Published: 2026-08-25
- Updated: 2026-08-25
- Publisher: AI Free API (https://www.aifreeapi.com)

截至 **2026 年 8 月 25 日**，大多数新的 Gemini Developer API 文本任务可以先从 `gemini-3.7-flash` 开始。它是当前稳定版（GA）的最新 Flash，Google 将它定位为面向编码、代理式工作流和可靠多步执行的主力模型。若任务是分类、抽取、翻译、文档分流等高吞吐工作，`gemini-3.5-flash-lite` 更贴近低延迟和成本优先的目标。`gemini-3.1-pro-preview` 仍有验证价值，但它是 Preview，不应只因名称里有 Pro 就直接成为生产默认值。

这篇对比只讨论 Gemini Developer API 中“可接收文本、图片、视频、音频或 PDF，并输出文本”的通用模型。图像生成、Live 实时语音、TTS、嵌入模型，以及 Gemini 网页或 App 的订阅套餐，是不同的产品和计费面。

## 先看结论：按任务风险选，而不是按名字选

| 你的工作负载 | 建议先测的模型 | 为什么 | 需要留意 |
| --- | --- | --- | --- |
| 新应用、编码助手、复杂多步工具调用 | `gemini-3.7-flash` | 当前最新 GA Flash，质量、速度、工具能力与生命周期较均衡 | 默认 thinking 为 medium；复杂请求的输出 token 仍会影响延迟和账单 |
| 已在 3.6 Flash 上稳定运行 | `gemini-3.6-flash`，同时评估 3.7 | 同为 GA，且 2026 年底前标准促销价相同 | 新功能开发不必主动锁死旧一代；应保留可回退配置 |
| 大批量分类、结构化抽取、翻译、轻量子任务 | `gemini-3.5-flash-lite` | 低延迟、低成本，官方明确面向高吞吐与简单自动化 | “Lite”不是任何任务都更省；失败重试和过度 thinking 会吞掉单价优势 |
| 已有 3.1 Flash-Lite，成本极敏感 | `gemini-3.1-flash-lite` | 当前标准文本输入/输出单价更低 | 它是更早一代，官方退役页已把 3.5 Flash-Lite 列为替代方向，需计划迁移 |
| 高难推理、复杂代码或自定义工具组合 | `gemini-3.1-pro-preview` 与 3.7 Flash 做同题对照 | Pro Preview 仍针对复杂推理、软件工程和精确工具使用 | Preview 会变化；没有免费付费层；长 prompt 价格会跃升 |
| 仍在 2.5 Pro / Flash / Flash-Lite | 立即建立迁移测试 | 官方列出的最早 shutdown date 是 2026-10-16 | 不要等生产请求报错才更换 model ID |

如果只能先选一个，选 `gemini-3.7-flash`。如果能维护两级路由，让 Flash-Lite 处理边界清晰的轻任务，把失败、歧义大或步骤多的请求升级到 3.7 Flash，通常比“所有请求都走最强型号”更容易控制成本。

![Gemini 文本模型任务路由图，根据输出是否可校验、多步工具需求、现有 3.6 系统、Preview 风险和旧 2.5 版本选择模型](https://www.aifreeapi.com/posts/zh/gemini-3-0-api/img/task-routing.webp)

## 当前文本输出主线到底有哪些模型

[Google 的当前模型总览](https://ai.google.dev/gemini-api/docs/models)把 3.7 Flash、3.6 Flash、3.5 Flash、3.5 Flash-Lite 和 3.1 Flash-Lite 列为稳定版；3.1 Pro 与 3 Flash 仍标记为 Preview。这里的版本状态比昵称重要，因为真正发 API 请求时需要的是准确 model ID。

### Gemini 3.7 Flash：新项目的合理默认值

`gemini-3.7-flash` 在 2026 年 8 月成为 GA。[官方模型页](https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash)列出 1,048,576 输入 token 和 65,536 输出 token 上限，支持缓存、代码执行、函数调用、结构化输出、搜索 grounding、URL context 等常用能力。Google 特别强调编码、代理式执行和可靠多步任务。

这不等于它对所有私有数据都必然胜出。更准确的用法是：把它设为候选默认值，再用真实任务验证首次成功率、工具调用正确率、P95 延迟与每个成功结果的总 token 成本。

### Gemini 3.6 Flash：可用的稳定回退，而非新项目终点

`gemini-3.6-flash` 也是 GA，能力面与 3.7 接近，并且两者在 2026 年底前使用相同的标准促销价。已有稳定系统不必为了版本号立刻切换，但应在同一组测试样本上比较 3.7，并把模型 ID 放进配置而不是写死在业务逻辑中。

当 3.7 在某类 prompt 或工具链上出现回归时，3.6 是清晰的稳定回退。反过来，如果 3.7 在成功率相同的情况下减少重试或输出冗余，即使单次标价相同，它的每个成功任务成本也可能更低。

### Gemini 3.5 Flash：仍是 GA，但已不是优先起点

`gemini-3.5-flash` 仍为稳定版，也有 1M 输入上下文和 65k 输出上限。不过当前总览把它描述为 legacy Flash；其标准价格还高于 3.7/3.6 的年内促销价。它更适合作为现有系统的兼容基线或回退候选，而不是新接入的第一选择。

### Flash-Lite：把便宜留给可定义的任务

`gemini-3.5-flash-lite` 不是“低配聊天模型”的简单同义词。[官方模型页](https://ai.google.dev/gemini-api/docs/models/gemini-3.5-flash-lite)把它定位为低延迟、高吞吐的多模态模型，适合文档解析、简单数据抽取和子代理任务。它同样支持 1,048,576 输入和 65,536 输出 token，但共享上下文规格不代表共享推理质量。

Flash-Lite 最适合有明确完成标准的任务，例如：输出必须符合 JSON Schema、分类标签集合固定、抽取字段可校验、翻译结果可抽样复核。对于开放式架构设计、长链路调试或多工具计划，错误重试一次就可能抵消省下的 token 单价。

`gemini-3.1-flash-lite` 目前价格更低，旧系统也可以继续使用，但它的生命周期短于 3.5 Flash-Lite。新项目若预计运行数月以上，应该把迁移成本纳入选择，而不是只比较今天的输入单价。

### Gemini 3.1 Pro Preview：用验证结果换取承担 Preview 的理由

`gemini-3.1-pro-preview` 面向复杂问题、软件工程和精确工具使用。它也支持 1M 输入与 65k 输出，并提供单独的 `gemini-3.1-pro-preview-customtools` 端点，偏向 bash 与自定义工具混合的代理工作流。

关键限制在名称最后：Preview。它可能在成为稳定版之前发生行为、限额或合同变化。合理策略不是全面切到 Pro，而是挑出 Flash 最难完成、失败代价又高的任务，与 3.7 Flash 做盲测；只有质量增益能够覆盖更高价格、延迟和变更风险时，才把这些任务路由给 Pro Preview。

## 2026 年 8 月的标准 API 价格

下表来自 [Gemini Developer API 官方价格页](https://ai.google.dev/gemini-api/docs/pricing)，单位为美元/每百万 tokens，适用于标准付费推理。输出价包含 thinking tokens；Batch、Flex 和 Priority 有另一组价格，不能直接混用。

| 模型 | 标准输入 | 标准输出（含 thinking） | 当前状态 |
| --- | ---: | ---: | --- |
| Gemini 3.7 Flash | $0.75 | $3.75 | GA；促销价至 2026-12-31，之后计划为 $1.50 / $7.50 |
| Gemini 3.6 Flash | $0.75 | $3.75 | GA；同一促销期限 |
| Gemini 3.5 Flash | $1.50 | $9.00 | GA，旧一代 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | GA |
| Gemini 3.1 Flash-Lite | $0.25（文本/图片/视频） | $1.50 | GA，较早一代 |
| Gemini 3.1 Pro Preview | $2.00（prompt ≤200k）；$4.00（>200k） | $12.00；$18.00 | Preview |

价格表不能单独决定模型。实际成本更接近：

`每个成功任务成本 = 输入 + thinking/输出 + 工具调用相关消耗 + 重试 + 缓存存储`

例如，一个 $0.30 输入价的模型如果经常输出过长、调用错误工具或需要重试，可能比一次完成的 $0.75 模型更贵。对生产系统，至少同时记录成功率、P95 延迟、输入 token、输出/思考 token 与重试次数。

免费层也要单独理解。官方价格页说明，符合条件的模型可有免费输入和输出，但模型、项目与地区的可用性和限额会变化；免费层提交的内容可能用于改进 Google 产品，而付费层页面写明不会用于此目的。敏感或生产数据不应只因“免费”就直接进入未评估的利用面。

## thinking level 会同时改变质量、延迟和账单

[官方 thinking 文档](https://ai.google.dev/gemini-api/docs/thinking)显示，不同模型的默认与可选级别并不完全一样：3.7 Flash 默认 medium，支持 low、medium、high；3.6 和 3.5 Flash-Lite 还支持 minimal；3.1 Pro Preview 默认 high。

这意味着比较时必须固定 thinking 配置。否则你可能不是在比较模型，而是在比较不同的推理预算。低延迟聊天或简单抽取可先从 low/minimal 验证；复杂编码、数学和多工具任务可提高级别，但要同时观察 thinking tokens 和超时率。不要继续沿用已经废弃的 `temperature`、`top_p`、`top_k` 作为 3.7 的主要调节手段；[3.7 迁移指南](https://ai.google.dev/gemini-api/docs/latest-model)要求移除这些参数并使用 `thinking_level`。

![Gemini 文本模型落地评测框架，展示测试集设计、固定配置、并行评测、成功率、延迟、token、工具调用和每个成功任务成本](https://www.aifreeapi.com/posts/zh/gemini-3-0-api/img/evaluation-framework.webp)

## 从 2.5 或更早版本迁移时，别只改字符串

[官方退役时间表](https://ai.google.dev/gemini-api/docs/deprecations)列出：Gemini 2.0 Flash 与 Flash-Lite 已在 2026 年 6 月 1 日关闭；2.5 Pro、2.5 Flash、2.5 Flash-Lite 的最早 shutdown date 为 2026 年 10 月 16 日。Google 也说明这些是最早可能日期，确切通知仍可能更新。

一次安全迁移至少包含以下动作：

1. 盘点代码、环境变量、队列任务和配置中心里的所有 model ID。
2. 用固定样本比较旧模型与目标模型，覆盖正常输入、长上下文、工具失败、结构化输出和安全拒绝。
3. 检查 3.x 的参数、thought signature、函数响应格式与多轮状态管理要求。
4. 把新旧模型放进可切换配置，先灰度，再扩大流量。
5. 上线后按“每个成功任务”观察质量、延迟和成本，而不是只看单次请求价格。

如果今天开始新项目，`gemini-3.7-flash` 是最省解释成本的默认值；如果工作负载高度重复且可校验，增加 `gemini-3.5-flash-lite` 作为廉价路由；如果少数复杂任务仍达不到要求，再用同题测试证明 `gemini-3.1-pro-preview` 的价值。这样的选择不是追逐型号，而是把能力、成本与版本风险放到同一个可回退的系统里。
