AIFreeAPI Logo

DeepSeek 2026 最新模型怎么选:V4 Pro、V4 Flash 与 Vision Exp 对比

A
9 分钟阅读AI 模型对比

文本和常规 Agent 先从 V4 Flash 建立基线;只有复杂推理或生产 Agent 的成功率能覆盖价差时再用 V4 Pro;图片输入必须转向仍属实验路线的 Vision Exp。

DeepSeek V4 Flash、V4 Pro 与 Vision Exp 当前 API 路线、共同规格、峰谷价格和选型条件总览

截至 2026 年 8 月 26 日,DeepSeek 官方 API 的当前选择已经不是 R1 与 V3 的二选一,而是三条 V4 路线:deepseek-v4-flashdeepseek-v4-pro 和实验性的 deepseek-v4-flash-vision-exp

如果要先得到一个可执行结论:

  • 纯文本、结构化输出和常规 Agent,先用 V4 Flash 建立质量与成本基线;
  • 复杂代码、长链工具调用或错误代价高的任务,把 V4 Pro 加入同一套验收测试;
  • 只有输入里真的包含截图、图表或照片时,才考虑 Vision Exp,并为实验型号准备回退;
  • R1、V3.2 和旧的 deepseek-chat / deepseek-reasoner 仍有历史与自托管价值,但不应继续充当新官方 API 项目的默认模型名。

这里比较的是 DeepSeek 官方服务。App/Web 的模型入口、官方 API ID、开放权重仓库和第三方网关是不同利用面,不能用其中一个的名称、价格或限制替另一个做承诺。

当前家族先看输入,再看能力档位

DeepSeek 的当前 API 首页列出了三个可调用 ID。它们都能处理文本,但只有 Vision Exp 接受图片。

当前 API ID更合适的起点需要接受的边界
deepseek-v4-flash对话、抽取、改写、结构化输出、日常编码、成本敏感的 Agent复杂知识与高难 Agent 任务可能需要 Pro;仍要用自己的工具与代码库验证
deepseek-v4-pro高难推理、复杂代码修改、长链工具协作、错误代价高的生产任务输入与输出价格约为 Flash 的 3 倍,不能只因“旗舰”而默认全量使用
deepseek-v4-flash-vision-exp截图理解、OCR 辅助、图表分析、图文 Agent是实验型号;视觉行为、接口与稳定性都应设置回退和变更监控

模型 ID 背后当前分别指向 V4-Flash-0731V4-Pro-0813V4-Flash-Vision-Exp。DeepSeek 的更新日志显示,V4 Pro 在 8 月 13 日进入 GA,并覆盖 App、Web 和 API;Vision Exp 在 8 月 21 日上线 API 平台,官方明确标为实验型号。

“Pro 一定更好”不是足够的路由规则。更有用的问题是:在相同 prompt、工具定义、推理强度和验收标准下,Pro 多通过了多少任务?这些成功是否值得额外的 token 成本与延迟?

按输入类型、任务风险与质量收益选择 DeepSeek V4 Flash、V4 Pro 或实验性 Vision Exp 的任务路由图
按输入类型、任务风险与质量收益选择 DeepSeek V4 Flash、V4 Pro 或实验性 Vision Exp 的任务路由图

1M 上下文是共同上限,不是 Pro 的独占优势

DeepSeek 的模型与价格页为三个当前 API 型号都列出 100 万 token 上下文最高 38.4 万 token 输出,并标注 JSON Output、Tool Calls、Responses API 与 Anthropic API 支持。

因此,单凭“需要长上下文”无法在 Flash 与 Pro 之间做选择。真正会改变结果的是:

  • 模型能否从长输入中找到正确证据,而不是只接受它;
  • 任务需要多少推理与工具轮次;
  • 首次通过率、重试率和人工修订量;
  • 输入是否能稳定命中上下文缓存;
  • 输出是否被无意放大到昂贵的长度。

开放权重规格也要与托管 API 分开。DeepSeek 的官方 V4 模型仓库列出 Pro 为 1.6T 总参数、49B 激活参数,Flash 为 284B 总参数、13B 激活参数,二者均采用 MoE 并提供 MIT 许可权重。这说明可以规划自托管路线,不说明你的硬件、量化方案或推理框架能复现官方 API 的吞吐、质量和工具行为。

价格要同时看时段、缓存和输出

DeepSeek 在 2026 年 8 月开始采用工作日峰谷价。官方按 美元/100 万 token计费;峰值为周一至周五 01:00–04:00 与 06:00–10:00 UTC。换算为中国标准时间,是工作日 09:00–12:00 与 14:00–18:00。其他时段为谷价。

下表是 2026 年 8 月 26 日官方价格:

模型时段输入:缓存命中输入:缓存未命中输出
V4 Flash / Vision Exp$0.007$0.22$0.66
V4 Flash / Vision Exp$0.014$0.44$1.32
V4 Pro$0.022$0.66$1.98
V4 Pro$0.044$1.32$3.96

一项任务若有 20 万未命中输入 token 和 2 万输出 token,在谷时调用 Flash 的模型费约为:

0.2 × $0.22 + 0.02 × $0.66 = $0.0572

同一 token 量使用 Pro 约为:

0.2 × $0.66 + 0.02 × $1.98 = $0.1716

这个算例只比较官方模型 token 费,不包含重试、第三方平台加价或工程成本。若 Pro 能显著减少重试与人工修订,它可能有更低的“每个合格结果成本”;若没有可测的成功率差异,Flash 通常更合理。

DeepSeek 三条当前 API 路线的输入决策、能力边界、峰谷价格、成本算例与六步小规模验证指南
DeepSeek 三条当前 API 路线的输入决策、能力边界、峰谷价格、成本算例与六步小规模验证指南

思考模式不是另一个模型

V4 Flash 与 V4 Pro 都能开启或关闭 thinking,并选择 lowhighmax 推理强度。官方思考模式文档说明 thinking 默认开启,默认强度为 high;兼容客户端传入 mediumxhigh 时,当前会映射为 high

一个清楚的 OpenAI SDK 调用可以显式写出两层选择:

python
from openai import OpenAI client = OpenAI( api_key="YOUR_DEEPSEEK_API_KEY", base_url="https://api.deepseek.com", ) response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "审查这段变更并列出阻塞上线的问题。"}], reasoning_effort="high", extra_body={"thinking": {"type": "enabled"}}, )

先固定模型、改变 effort,再固定 effort、比较模型,比把 Flash-low 与 Pro-max 直接对打更容易解释差异。还要注意两个接口合同:thinking 模式会忽略 temperaturetop_p 等采样参数;带 tools 的多轮对话必须按官方格式回传 reasoning_content,否则可能收到 400。

Vision Exp 解决的是输入合同,不是“更强的 Flash”

deepseek-v4-flash-vision-exp 的关键差别是接受图片。官方Vision 指南支持 JPEG、PNG、GIF、WebP,可通过 base64、外部 URL 或 Files API 传入;非视觉型号收到图片会返回 400。

Vision Exp 适合验证这些任务:

  • 从界面截图中定位控件或错误信息;
  • 读取表格、收据和图表,再结合文本规则判断;
  • 让 Agent 同时理解视觉状态与工具结果;
  • 在文本抽取前做低成本的图片理解。

但“Exp”必须进入架构决策。生产接入至少记录模型版本与请求形态,为纯文本路径保留 Flash 回退,对关键视觉结论设置结构化校验,并监控官方变更。图片会折算为输入 token;当前规则下单图最高 384 token,但文件大小、请求体、图片数量与尺寸仍分别有限制。

R1、V3.2 和旧模型名应该放在哪里

R1 是 DeepSeek 推理路线的重要一代,V3.2 也仍存在于研究、开放权重和旧教程中;它们有助于理解技术演进或复现实验。不过,DeepSeek 在 2026 年 4 月公布 V4 API 时,已经把 deepseek-chatdeepseek-reasoner 放入停用迁移窗口,并让它们临时对应 V4 Flash 的 non-thinking 与 thinking 模式。

对新代码,直接使用当前 ID 更清楚:

  • deepseek-v4-flash:文本与常规 Agent 的默认候选;
  • deepseek-v4-pro:需要用验收结果证明的升级候选;
  • deepseek-v4-flash-vision-exp:带实验边界的视觉候选。

第三方网关可能继续保留旧别名,也可能把相同名称指向不同快照。迁移时应记录实际 provider、base URL、返回的版本信息和功能测试,不能只改一行 model 名就认定行为等价。

用 12 个代表任务完成选型

与其比较几十个互不相干的公开榜单,不如从真实工作负载抽取 12 个任务:4 个常规任务、4 个最难任务、2 个工具失败或异常输入、2 个长上下文或视觉边界。对 Flash-high、Pro-high 和必要时的 Vision Exp 使用相同验收条件,记录:

  1. 首次合格与最终合格数量;
  2. reasoning、input、output token 与缓存命中;
  3. 工具选择、参数和多轮状态是否正确;
  4. 端到端延迟、重试和人工修订时间;
  5. 每个合格结果的总成本。

如果 Flash 已通过所有关键任务,就停在 Flash;如果 Pro 只改善少数难例,就只路由这些任务;如果视觉输入不是必需,就不要为了“新”而承担实验型号风险。需要继续评估 Pro 的接入与取舍,可以阅读同语言的 DeepSeek V4 Pro API 指南

最终选择不是一张永久榜单,而是一条可以复查的路由:先用最低成本的候选满足验收,再为可测的质量差异付费,并为实验能力保留回退。