AIFreeAPI Logo

DeepSeek V4 Pro API: актуальная версия, цена и подключение

A
4 min readГайды по AI-моделям

Используйте стабильный ID deepseek-v4-pro, рассчитывайте цену по фактическому кэшу и выводу и отдельно проверяйте условия оплаты выбранного маршрута.

Схема идентификации, расчёта цены и подключения DeepSeek V4 Pro API

На 13 августа 2026 года официальный API DeepSeek принимает стабильный идентификатор deepseek-v4-pro. Сейчас он направляет запросы на версию DeepSeek-V4-Pro-0813. Это название модели, а не тариф подписки и не другое имя V4 Flash.

Прямой вызов совместим с OpenAI SDK и использует base URL https://api.deepseek.com. Но для рабочего внедрения одной строки model мало: thinking mode включён по умолчанию, цена кэшированного и нового ввода различается на два порядка, а DeepSeek уже предупредила о скором существенном повышении общих тарифов API.

Какой контракт подтверждает DeepSeek

В актуальной таблице моделей и цен указаны следующие параметры:

ПараметрDeepSeek V4 Pro
ID для APIdeepseek-v4-pro
Текущая обслуживаемая версияDeepSeek-V4-Pro-0813
OpenAI base URLhttps://api.deepseek.com
Anthropic base URLhttps://api.deepseek.com/anthropic
Контекст1 млн токенов
Максимальный вывод384 тыс. токенов
Thinkingвключён по умолчанию, можно отключить
Лимит concurrency500

В конфигурации приложения оставляйте стабильный ID, а версию 0813 записывайте в отчётах испытаний и инцидентах. Тогда обновление модели за тем же ID не потребует выдумывать неподдерживаемое датированное имя, но результат теста сохранит временной контекст.

Старые deepseek-chat и deepseek-reasoner не являются синонимами Pro. В журнале изменений они описаны как переходные имена для non-thinking и thinking режимов V4 Flash.

Осторожно и со статусом релиза. Апрельская официальная публикация называла семейство V4 preview, а запись от 31 июля сообщала, что официальный релиз Pro последует позднее. Текущая документация уже показывает версию 0813, но отдельного проверенного объявления с явной меткой GA в использованных источниках нет. Корректно говорить, что API доступен сейчас; дописывать GA необязательно.

Официальная цена в USD и реальная цена маршрута — не одно и то же

Прямой тариф DeepSeek за 1 млн токенов на дату проверки:

  • кэшированный ввод — $0,003625;
  • ввод без попадания в кэш — $0,435;
  • вывод — $0,87.

Например, анализ репозитория с 600 тыс. кэшированных входных токенов, 200 тыс. новых входных и 30 тыс. выходных стоит:

0,6 × $0,003625 + 0,2 × $0,435 + 0,03 × $0,87 = $0,115275

Это арифметика по официальному тарифу на 13 августа 2026 года, а не счёт посредника. В ней нет налогов, комиссии за конвертацию, наценки gateway, внешних инструментов и повторов. DeepSeek прямо предупреждает, что ожидает значительного повышения цены, но не публикует в проверенной таблице окончательный новый тариф.

Если прямое пополнение или официальный маршрут недоступны, сначала отделите три вопроса:

  1. какой endpoint и model ID вызывает выбранный сервис;
  2. в какой валюте и по какому тарифу он выставляет счёт;
  3. какие данные, возвраты, лимиты и поддержка регулируются его собственными условиями.

Рублёвая цена стороннего сервиса не становится официальной ценой DeepSeek. И наоборот, официальный USD-тариф не гарантирует, что к нему не добавится комиссия локального маршрута. Перед оплатой проверьте публичный договор, юрисдикцию и фактический список моделей конкретного поставщика.

Слои фактической стоимости: официальный тариф, оплата, маршрут, инструменты и повторы
Слои фактической стоимости: официальный тариф, оплата, маршрут, инструменты и повторы

Низкая цена кэша тоже не означает, что весь длинный prompt получит скидку. Попадание требует стабильного префикса. Системные правила, неизменная карта проекта и общий пакет документов подходят для повторного использования; новые инструкции, результаты tools и растущая история обычно создают новый ввод. Смотрите на cached tokens в usage, а не на теоретический максимум.

Первый запрос через Python

Официальный quick start показывает работу через OpenAI SDK. Секрет храните в переменной окружения:

python
import os from openai import OpenAI client = OpenAI( api_key=os.environ["DEEPSEEK_API_KEY"], base_url="https://api.deepseek.com", ) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[ {"role": "system", "content": "Проверяй изменения кода консервативно."}, {"role": "user", "content": "Найди риски отката в этом плане миграции."}, ], reasoning_effort="high", extra_body={"thinking": {"type": "enabled"}}, stream=False, ) print(response.choices[0].message.content)

Для короткой классификации или преобразования проверьте non-thinking:

python
extra_body={"thinking": {"type": "disabled"}}

После smoke test запишите model, usage, непустой финальный content, время, ошибки и retries. Не сохраняйте API key и чувствительный prompt в обычный application log.

Thinking mode меняет правила запроса

По документации режима рассуждения thinking включён с effort high по умолчанию. Рабочие уровни — low, high и max; значения medium и xhigh отображаются в high.

Параметры temperature, top_p, presence_penalty и frequency_penalty в thinking mode не влияют на результат. Сервер может не вернуть ошибку, поэтому старая конфигурация создаёт ложное ощущение настройки. Для простой задачи отключите thinking, для сложной меняйте effort.

Критический нюанс появляется в tool loop. Если модель вернула reasoning_content, content и tool_calls, после выполнения инструмента добавьте в историю полное assistant message, затем сообщение role: tool. Потеря reasoning_content при продолжении thinking-вызова может привести к HTTP 400.

Проще всего добавлять объект сообщения, полученный от SDK, целиком. Руководство по tool calls отдельно описывает strict mode: он работает через /beta, требует strict: true и поддерживает ограниченное подмножество JSON Schema. Beta-режим не гарантирует любую схему.

Не заполняйте окно 1M без необходимости

Контекст 1 млн и максимум вывода 384K — разные ограничения. Первое определяет рабочее окно, второе — потолок ответа. Ни одно не советует отправлять весь монорепозиторий в каждом запросе.

Большой ввод без кэша увеличивает стоимость и prefill, а лишние файлы ухудшают фокус. Сначала выбирайте релевантные документы и код поиском, затем расширяйте контекст, если проверка результата показывает, что модели не хватило конкретных данных.

От репозитория через поиск релевантных файлов к достаточному контексту модели
От репозитория через поиск релевантных файлов к достаточному контексту модели

Когда Pro оправдывает цену относительно Flash

По проверенному тарифу ввод без кэша и вывод Pro стоят чуть больше чем в три раза дороже Flash. Выбирайте по цене ошибки:

НагрузкаПервый кандидатЧто докажет пользу Pro
Классификация, извлечение, простой чатV4 FlashЗначимо меньше ошибок формата или фактов
Планирование по нескольким файламV4 ProМеньше пропущенных изменений и повторов
Длинная цепочка дорогих toolsТест ProВыше доля принятых задач при том же harness
Массовая работа с ясным validatorV4 FlashPro снижает полную цену принятой задачи

Для более широкого выбора откройте русское сравнение DeepSeek V4 Flash, Kimi K3 и GLM-5.2. Там решается задача выбора между тремя моделями; здесь — точное подключение Pro.

Испытайте Pro и Flash на 10–30 рабочих задачах с одинаковыми файлами, tools, timeout, retry budget и приёмкой. Считайте кэшированный и новый ввод, вывод, вмешательства человека и полное время. Победитель — не модель с самой красивой демонстрацией, а маршрут с более низкой стоимостью результата, который прошёл проверку.

Перед внедрением ещё раз откройте текущий тариф и журнал изменений. Стабильный ID упрощает код, но не фиксирует навсегда версию, цену или условия оплаты.