На 13 августа 2026 года официальный API DeepSeek принимает стабильный идентификатор deepseek-v4-pro. Сейчас он направляет запросы на версию DeepSeek-V4-Pro-0813. Это название модели, а не тариф подписки и не другое имя V4 Flash.
Прямой вызов совместим с OpenAI SDK и использует base URL https://api.deepseek.com. Но для рабочего внедрения одной строки model мало: thinking mode включён по умолчанию, цена кэшированного и нового ввода различается на два порядка, а DeepSeek уже предупредила о скором существенном повышении общих тарифов API.
Какой контракт подтверждает DeepSeek
В актуальной таблице моделей и цен указаны следующие параметры:
| Параметр | DeepSeek V4 Pro |
|---|---|
| ID для API | deepseek-v4-pro |
| Текущая обслуживаемая версия | DeepSeek-V4-Pro-0813 |
| OpenAI base URL | https://api.deepseek.com |
| Anthropic base URL | https://api.deepseek.com/anthropic |
| Контекст | 1 млн токенов |
| Максимальный вывод | 384 тыс. токенов |
| Thinking | включён по умолчанию, можно отключить |
| Лимит concurrency | 500 |
В конфигурации приложения оставляйте стабильный ID, а версию 0813 записывайте в отчётах испытаний и инцидентах. Тогда обновление модели за тем же ID не потребует выдумывать неподдерживаемое датированное имя, но результат теста сохранит временной контекст.
Старые deepseek-chat и deepseek-reasoner не являются синонимами Pro. В журнале изменений они описаны как переходные имена для non-thinking и thinking режимов V4 Flash.
Осторожно и со статусом релиза. Апрельская официальная публикация называла семейство V4 preview, а запись от 31 июля сообщала, что официальный релиз Pro последует позднее. Текущая документация уже показывает версию 0813, но отдельного проверенного объявления с явной меткой GA в использованных источниках нет. Корректно говорить, что API доступен сейчас; дописывать GA необязательно.
Официальная цена в USD и реальная цена маршрута — не одно и то же
Прямой тариф DeepSeek за 1 млн токенов на дату проверки:
- кэшированный ввод — $0,003625;
- ввод без попадания в кэш — $0,435;
- вывод — $0,87.
Например, анализ репозитория с 600 тыс. кэшированных входных токенов, 200 тыс. новых входных и 30 тыс. выходных стоит:
0,6 × $0,003625 + 0,2 × $0,435 + 0,03 × $0,87 = $0,115275
Это арифметика по официальному тарифу на 13 августа 2026 года, а не счёт посредника. В ней нет налогов, комиссии за конвертацию, наценки gateway, внешних инструментов и повторов. DeepSeek прямо предупреждает, что ожидает значительного повышения цены, но не публикует в проверенной таблице окончательный новый тариф.
Если прямое пополнение или официальный маршрут недоступны, сначала отделите три вопроса:
- какой endpoint и model ID вызывает выбранный сервис;
- в какой валюте и по какому тарифу он выставляет счёт;
- какие данные, возвраты, лимиты и поддержка регулируются его собственными условиями.
Рублёвая цена стороннего сервиса не становится официальной ценой DeepSeek. И наоборот, официальный USD-тариф не гарантирует, что к нему не добавится комиссия локального маршрута. Перед оплатой проверьте публичный договор, юрисдикцию и фактический список моделей конкретного поставщика.

Низкая цена кэша тоже не означает, что весь длинный prompt получит скидку. Попадание требует стабильного префикса. Системные правила, неизменная карта проекта и общий пакет документов подходят для повторного использования; новые инструкции, результаты tools и растущая история обычно создают новый ввод. Смотрите на cached tokens в usage, а не на теоретический максимум.
Первый запрос через Python
Официальный quick start показывает работу через OpenAI SDK. Секрет храните в переменной окружения:
pythonimport os from openai import OpenAI client = OpenAI( api_key=os.environ["DEEPSEEK_API_KEY"], base_url="https://api.deepseek.com", ) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[ {"role": "system", "content": "Проверяй изменения кода консервативно."}, {"role": "user", "content": "Найди риски отката в этом плане миграции."}, ], reasoning_effort="high", extra_body={"thinking": {"type": "enabled"}}, stream=False, ) print(response.choices[0].message.content)
Для короткой классификации или преобразования проверьте non-thinking:
pythonextra_body={"thinking": {"type": "disabled"}}
После smoke test запишите model, usage, непустой финальный content, время, ошибки и retries. Не сохраняйте API key и чувствительный prompt в обычный application log.
Thinking mode меняет правила запроса
По документации режима рассуждения thinking включён с effort high по умолчанию. Рабочие уровни — low, high и max; значения medium и xhigh отображаются в high.
Параметры temperature, top_p, presence_penalty и frequency_penalty в thinking mode не влияют на результат. Сервер может не вернуть ошибку, поэтому старая конфигурация создаёт ложное ощущение настройки. Для простой задачи отключите thinking, для сложной меняйте effort.
Критический нюанс появляется в tool loop. Если модель вернула reasoning_content, content и tool_calls, после выполнения инструмента добавьте в историю полное assistant message, затем сообщение role: tool. Потеря reasoning_content при продолжении thinking-вызова может привести к HTTP 400.
Проще всего добавлять объект сообщения, полученный от SDK, целиком. Руководство по tool calls отдельно описывает strict mode: он работает через /beta, требует strict: true и поддерживает ограниченное подмножество JSON Schema. Beta-режим не гарантирует любую схему.
Не заполняйте окно 1M без необходимости
Контекст 1 млн и максимум вывода 384K — разные ограничения. Первое определяет рабочее окно, второе — потолок ответа. Ни одно не советует отправлять весь монорепозиторий в каждом запросе.
Большой ввод без кэша увеличивает стоимость и prefill, а лишние файлы ухудшают фокус. Сначала выбирайте релевантные документы и код поиском, затем расширяйте контекст, если проверка результата показывает, что модели не хватило конкретных данных.

Когда Pro оправдывает цену относительно Flash
По проверенному тарифу ввод без кэша и вывод Pro стоят чуть больше чем в три раза дороже Flash. Выбирайте по цене ошибки:
| Нагрузка | Первый кандидат | Что докажет пользу Pro |
|---|---|---|
| Классификация, извлечение, простой чат | V4 Flash | Значимо меньше ошибок формата или фактов |
| Планирование по нескольким файлам | V4 Pro | Меньше пропущенных изменений и повторов |
| Длинная цепочка дорогих tools | Тест Pro | Выше доля принятых задач при том же harness |
| Массовая работа с ясным validator | V4 Flash | Pro снижает полную цену принятой задачи |
Для более широкого выбора откройте русское сравнение DeepSeek V4 Flash, Kimi K3 и GLM-5.2. Там решается задача выбора между тремя моделями; здесь — точное подключение Pro.
Испытайте Pro и Flash на 10–30 рабочих задачах с одинаковыми файлами, tools, timeout, retry budget и приёмкой. Считайте кэшированный и новый ввод, вывод, вмешательства человека и полное время. Победитель — не модель с самой красивой демонстрацией, а маршрут с более низкой стоимостью результата, который прошёл проверку.
Перед внедрением ещё раз откройте текущий тариф и журнал изменений. Стабильный ID упрощает код, но не фиксирует навсегда версию, цену или условия оплаты.



