截至 2026 年 8 月 13 日,DeepSeek 官方 API 可以直接使用模型名 deepseek-v4-pro,该稳定调用名当前指向 DeepSeek-V4-Pro-0813。它不是订阅会员,也不是 V4 Flash 的另一个写法,而是一条价格、并发和适用任务都不同的 API 合同。
如果你只想先把接口跑通,核心配置很短:OpenAI 兼容 base URL 是 https://api.deepseek.com,模型名 是 deepseek-v4-pro。但要做预算或上线 Agent,还必须注意三个条件:思考模式默认开启、缓存命中与未命中价格相差很大、官方已经预告 API 将显著涨价。
先确认你调用的到底是哪一个模型
DeepSeek 的当前模型与价格页列出的 Pro 合同如下:
| 项目 | DeepSeek V4 Pro 当前值 |
|---|---|
| API 模型名 | deepseek-v4-pro |
| 当前服务版本 | DeepSeek-V4-Pro-0813 |
| OpenAI 格式 base URL | https://api.deepseek.com |
| Anthropic 格式 base URL | https://api.deepseek.com/anthropic |
| 上下文长度 | 1M tokens |
| 最大输出 | 384K tokens |
| 思考模式 | 支持开启/关闭,默认开启 |
| 并发上限 | 500 |
模型名和版本号承担不同职责。应用配置应使用稳定的 deepseek-v4-pro;0813 用来记录你当时实际面对的服务版本。这样 DeepSeek 更新底层版本时,你不用猜一个不存在的 dated API ID,同时还能在评测和故障记录里保留版本背景。
不要继续使用 deepseek-chat 或 deepseek-reasoner 来“间接调用 Pro”。DeepSeek 的变更记录把它们归为旧别名,早期过渡期对应的是 V4 Flash 的非思考/思考模式,并不等于 Pro。
当前价格怎么计算?
官方价卡按每 100 万 tokens 计费,Pro 当前价格是:
- 缓存命中输入:$0.003625 / 1M tokens
- 缓存未命中输入:$0.435 / 1M tokens
- 输出:$0.87 / 1M tokens
一次请求的基础费用可以写成:
费用 = 命中缓存输入量 × $0.003625/M + 未命中输入量 × $0.435/M + 输出量 × $0.87/M
假设某次代码库分析使用 20 万未命中输入、60 万缓存命中输入,并生成 3 万输出:
0.2 × $0.435 + 0.6 × $0.003625 + 0.03 × $0.87 = $0.115275
这个 $0.115275 只代表上述 token 结构和 2026 年 8 月 13 日价卡。它没有包含重试、工具服务、第三方网关加价、税费或人工返工。更重要的是,DeepSeek 已在价格页明确提示近期会整体上调 API 价格且预计涨幅较大,但尚未给出最终新价。因此,采购预算不应把当前单价锁死到季度或年度模型里。

缓存价很低也不代表整段长上下文都会自动按缓存命中计费。只有稳定前缀被实际复用时,账单里才会出现对应 cached tokens。系统提示词、固定仓库说明和不变的资料包适合放在前部;用户新问题、工具结果和不断变化的会话历史通常会形成未命中输入。
最小可运行的 Python 调用
DeepSeek 的首次 API 调用文档使用 OpenAI SDK。把密钥放入环境变量,不要写进代码仓库:
pythonimport os from openai import OpenAI client = OpenAI( api_key=os.environ["DEEPSEEK_API_KEY"], base_url="https://api.deepseek.com", ) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[ {"role": "system", "content": "你是严谨的代码审查助手。"}, {"role": "user", "content": "找出这段迁移计划中的回滚风险。"}, ], reasoning_effort="high", extra_body={"thinking": {"type": "enabled"}}, stream=False, ) print(response.choices[0].message.content)
成功标准不只是 HTTP 200。至少同时确认:返回的模型字段和 usage 可读取,最终 content 非空,输入/输出 token 被记录,错误与超时有明确处理,日志不保存 API key 或敏感提示词。
如果任务是分类、短格式转换或简单抽取,可以测试关闭思考模式:
pythonextra_body={"thinking": {"type": "disabled"}}
不要在思考模式下用 temperature、top_p、presence_penalty 或 frequency_penalty 调质量。官方思考模式说明指出这些参数会被忽略而不一定报错;真正有效的是 reasoning_effort 的 low、high 或 max。
Agent 接入最容易踩的两个坑
工具调用后丢掉 reasoning_content
普通对话中,上一轮的推理内容不需要反复回传。但在思考模式的工具调用过程中,模型返回的 assistant message 里可能同时包含 reasoning_content、content 和 tool_calls。执行工具后,下一次请求必须保留完整 assistant message,再追加 role: tool 的结果;只复制 content 可能触发 400。
最稳妥的做法是把 SDK 返回的整条 message 追加到历史,而不是手工挑字段。DeepSeek 的工具调用文档也特别区分了普通 tool calls 与使用 /beta base URL 的 strict schema 模式;后者仍是 Beta,不能当成所有 JSON Schema 都被支持。

把 1M context 当作应该填满的输入
1M 是上下文上限,不是建议用量,也不是 384K 最大输出的同义词。长上下文会增加未缓存输入费用、首轮处理时间和无关信息干扰。生产 Agent 更适合先检索真正相关的文件,再逐步扩大上下文,并记录每个成功任务的总 token、重试和人工介入。
什么时候选 Pro,什么时候先用 Flash?
Pro 的当前未缓存输入和输出价格都约为 Flash 的三倍,但“单次请求更贵”不能直接推出“不值得”。可以按任务风险做第一轮选择:
| 工作负载 | 更合理的第一候选 | 需要验证的结果 |
|---|---|---|
| 短问答、批量抽取、简单代码修改 | V4 Flash | 低成本下是否稳定满足格式与 tests |
| 跨文件规划、复杂调试、长链工具调用 | V4 Pro | 是否减少重试、漏改和人工接管 |
| 大量固定前缀的重复任务 | 两者同测 | 实际 cached tokens 与成功任务成本 |
| 只是想找最低单价 | V4 Flash | 不要用 Pro benchmark 替代 Flash 实测 |
若要把 DeepSeek 放进更广的国产模型候选集,可继续看同语种的 DeepSeek V4 Flash、Kimi K3 与 GLM-5.2 选型。那篇解决的是三模型选择;本文解决的是 Pro 的准确合同与接入。
最终不要以一次 demo 决定生产模型。准备 10–30 个真实任务,固定工具权限、超时、重试预算和验收条件,分别记录通过率、端到端耗时、缓存/未缓存输入、输出与人工介入。每个通过验收任务的总成本,比价卡上的一行单价更接近真实答案。
开始接入前,请再打开一次 DeepSeek 的官方价格页和变更记录。当前价格已经被官方标记为即将调整;能跑通今天的请求,不代表下个月仍应沿用同一预算。



