# DeepSeek V4 Pro API 指南：当前版本、价格、调用与选型

> 核对 DeepSeek V4 Pro 当前模型 ID、0813 服务版本、API 价格、思考模式和工具调用规则，并用可复算示例判断何时选 Pro。

- Source: https://www.aifreeapi.com/zh/posts/deepseek-v4-pro
- Language: zh
- Published: 2026-08-13
- Updated: 2026-08-13
- Publisher: AI Free API (https://www.aifreeapi.com)

截至 **2026 年 8 月 13 日**，DeepSeek 官方 API 可以直接使用模型名 `deepseek-v4-pro`，该稳定调用名当前指向 **DeepSeek-V4-Pro-0813**。它不是订阅会员，也不是 V4 Flash 的另一个写法，而是一条价格、并发和适用任务都不同的 API 合同。

如果你只想先把接口跑通，核心配置很短：OpenAI 兼容 base URL 是 `https://api.deepseek.com`，模型名是 `deepseek-v4-pro`。但要做预算或上线 Agent，还必须注意三个条件：**思考模式默认开启、缓存命中与未命中价格相差很大、官方已经预告 API 将显著涨价**。

![DeepSeek V4 Pro 的模型身份、成本与 API 接入决策图](https://www.aifreeapi.com/posts/zh/deepseek-v4-pro/img/cover.webp)

## 先确认你调用的到底是哪一个模型

DeepSeek 的[当前模型与价格页](https://api-docs.deepseek.com/quick_start/pricing/)列出的 Pro 合同如下：

| 项目 | DeepSeek V4 Pro 当前值 |
|---|---|
| API 模型名 | `deepseek-v4-pro` |
| 当前服务版本 | `DeepSeek-V4-Pro-0813` |
| OpenAI 格式 base URL | `https://api.deepseek.com` |
| Anthropic 格式 base URL | `https://api.deepseek.com/anthropic` |
| 上下文长度 | 1M tokens |
| 最大输出 | 384K tokens |
| 思考模式 | 支持开启/关闭，默认开启 |
| 并发上限 | 500 |

模型名和版本号承担不同职责。应用配置应使用稳定的 `deepseek-v4-pro`；`0813` 用来记录你当时实际面对的服务版本。这样 DeepSeek 更新底层版本时，你不用猜一个不存在的 dated API ID，同时还能在评测和故障记录里保留版本背景。

不要继续使用 `deepseek-chat` 或 `deepseek-reasoner` 来“间接调用 Pro”。DeepSeek 的[变更记录](https://api-docs.deepseek.com/updates/)把它们归为旧别名，早期过渡期对应的是 V4 Flash 的非思考/思考模式，并不等于 Pro。

## 当前价格怎么计算？

官方价卡按每 100 万 tokens 计费，Pro 当前价格是：

- 缓存命中输入：**$0.003625 / 1M tokens**
- 缓存未命中输入：**$0.435 / 1M tokens**
- 输出：**$0.87 / 1M tokens**

一次请求的基础费用可以写成：

`费用 = 命中缓存输入量 × $0.003625/M + 未命中输入量 × $0.435/M + 输出量 × $0.87/M`

假设某次代码库分析使用 20 万未命中输入、60 万缓存命中输入，并生成 3 万输出：

`0.2 × $0.435 + 0.6 × $0.003625 + 0.03 × $0.87 = $0.115275`

这个 **$0.115275** 只代表上述 token 结构和 2026 年 8 月 13 日价卡。它没有包含重试、工具服务、第三方网关加价、税费或人工返工。更重要的是，DeepSeek 已在价格页明确提示近期会整体上调 API 价格且预计涨幅较大，但尚未给出最终新价。因此，采购预算不应把当前单价锁死到季度或年度模型里。

![DeepSeek V4 Pro 一次请求由缓存输入、未命中输入和输出组成的费用图](https://www.aifreeapi.com/posts/zh/deepseek-v4-pro/img/cost-map.webp)

缓存价很低也不代表整段长上下文都会自动按缓存命中计费。只有稳定前缀被实际复用时，账单里才会出现对应 cached tokens。系统提示词、固定仓库说明和不变的资料包适合放在前部；用户新问题、工具结果和不断变化的会话历史通常会形成未命中输入。

## 最小可运行的 Python 调用

DeepSeek 的[首次 API 调用文档](https://api-docs.deepseek.com/)使用 OpenAI SDK。把密钥放入环境变量，不要写进代码仓库：

```python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "system", "content": "你是严谨的代码审查助手。"},
        {"role": "user", "content": "找出这段迁移计划中的回滚风险。"},
    ],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}},
    stream=False,
)

print(response.choices[0].message.content)
```

成功标准不只是 HTTP 200。至少同时确认：返回的模型字段和 usage 可读取，最终 `content` 非空，输入/输出 token 被记录，错误与超时有明确处理，日志不保存 API key 或敏感提示词。

如果任务是分类、短格式转换或简单抽取，可以测试关闭思考模式：

```python
extra_body={"thinking": {"type": "disabled"}}
```

不要在思考模式下用 `temperature`、`top_p`、`presence_penalty` 或 `frequency_penalty` 调质量。官方[思考模式说明](https://api-docs.deepseek.com/guides/thinking_mode/)指出这些参数会被忽略而不一定报错；真正有效的是 `reasoning_effort` 的 `low`、`high` 或 `max`。

## Agent 接入最容易踩的两个坑

### 工具调用后丢掉 reasoning_content

普通对话中，上一轮的推理内容不需要反复回传。但在思考模式的工具调用过程中，模型返回的 assistant message 里可能同时包含 `reasoning_content`、`content` 和 `tool_calls`。执行工具后，下一次请求必须保留完整 assistant message，再追加 `role: tool` 的结果；只复制 `content` 可能触发 400。

最稳妥的做法是把 SDK 返回的整条 message 追加到历史，而不是手工挑字段。DeepSeek 的[工具调用文档](https://api-docs.deepseek.com/guides/tool_calls/)也特别区分了普通 tool calls 与使用 `/beta` base URL 的 strict schema 模式；后者仍是 Beta，不能当成所有 JSON Schema 都被支持。

![thinking 模式工具调用中保留 reasoning_content 与完整 assistant message 的续接流程](https://www.aifreeapi.com/posts/zh/deepseek-v4-pro/img/tool-loop.webp)

### 把 1M context 当作应该填满的输入

1M 是上下文上限，不是建议用量，也不是 384K 最大输出的同义词。长上下文会增加未缓存输入费用、首轮处理时间和无关信息干扰。生产 Agent 更适合先检索真正相关的文件，再逐步扩大上下文，并记录每个成功任务的总 token、重试和人工介入。

## 什么时候选 Pro，什么时候先用 Flash？

Pro 的当前未缓存输入和输出价格都约为 Flash 的三倍，但“单次请求更贵”不能直接推出“不值得”。可以按任务风险做第一轮选择：

| 工作负载 | 更合理的第一候选 | 需要验证的结果 |
|---|---|---|
| 短问答、批量抽取、简单代码修改 | V4 Flash | 低成本下是否稳定满足格式与 tests |
| 跨文件规划、复杂调试、长链工具调用 | V4 Pro | 是否减少重试、漏改和人工接管 |
| 大量固定前缀的重复任务 | 两者同测 | 实际 cached tokens 与成功任务成本 |
| 只是想找最低单价 | V4 Flash | 不要用 Pro benchmark 替代 Flash 实测 |

若要把 DeepSeek 放进更广的国产模型候选集，可继续看同语种的 [DeepSeek V4 Flash、Kimi K3 与 GLM-5.2 选型](/zh/posts/deepseek-v4-flash-vs-kimi-k3-vs-glm-5-2)。那篇解决的是三模型选择；本文解决的是 Pro 的准确合同与接入。

最终不要以一次 demo 决定生产模型。准备 10–30 个真实任务，固定工具权限、超时、重试预算和验收条件，分别记录通过率、端到端耗时、缓存/未缓存输入、输出与人工介入。**每个通过验收任务的总成本**，比价卡上的一行单价更接近真实答案。

开始接入前，请再打开一次 DeepSeek 的[官方价格页](https://api-docs.deepseek.com/quick_start/pricing/)和[变更记录](https://api-docs.deepseek.com/updates/)。当前价格已经被官方标记为即将调整；能跑通今天的请求，不代表下个月仍应沿用同一预算。
