AIFreeAPI Logo

DeepSeek V4 Pro API 가이드: 현재 버전, 가격, 사용법

A
4 min readAI 모델 가이드

안정적인 호출 ID는 deepseek-v4-pro이고 현재 서비스 버전은 0813입니다. 무료 체험과 유료 API를 분리해 판단하세요.

DeepSeek V4 Pro API의 모델 확인, 비용 계산, 도입 판단 지도

DeepSeek V4 Pro는 공식 API에서 deepseek-v4-pro라는 안정적인 모델 ID로 호출할 수 있습니다. 2026년 8월 13일 기준 이 ID가 가리키는 현재 서비스 버전은 DeepSeek-V4-Pro-0813입니다. Pro는 구독 등급이 아니며 V4 Flash의 다른 이름도 아닙니다.

OpenAI SDK를 사용하면 첫 호출은 간단합니다. 그러나 운영에 들어가기 전에는 세 가지를 먼저 확인해야 합니다. thinking mode가 기본으로 켜져 있고, 캐시 적중·미적중 입력 단가 차이가 매우 크며, DeepSeek가 공식 가격표에서 전체 API 가격의 큰 폭 인상을 예고했습니다.

무료 웹 사용과 API 계약을 섞지 말아야 하는 이유

DeepSeek는 4월 V4 공개 당시 웹/앱에서 Expert Mode와 Instant Mode를 안내했습니다. 그러나 웹에서 모델을 체험하는 것과 개발자가 API key로 호출해 token 단위로 과금되는 것은 서로 다른 제품 경로입니다. 검색 결과의 “무료 사용” 문구만 보고 Pro API에 무료 tier나 무제한 호출이 있다고 결론 내릴 수 없습니다.

현재 공식 모델·가격표가 확인해 주는 API 계약은 다음과 같습니다.

항목DeepSeek V4 Pro 현재 값
API 모델 IDdeepseek-v4-pro
현재 서비스 버전DeepSeek-V4-Pro-0813
OpenAI 형식 base URLhttps://api.deepseek.com
Anthropic 형식 base URLhttps://api.deepseek.com/anthropic
컨텍스트100만 tokens
최대 출력384K tokens
thinking기본 활성화, 비활성화 가능
동시 실행 한도500

앱 설정에는 안정적인 모델 ID를 사용하고, 평가·장애 기록에는 실제 서비스 버전도 적어 두세요. ID 뒤의 모델이 업데이트돼도 코드는 유지하면서 어느 버전에서 결과가 나왔는지 추적할 수 있습니다.

deepseek-chatdeepseek-reasoner는 Pro의 별칭이 아닙니다. DeepSeek 변경 기록은 이 구형 이름들이 전환 기간에 V4 Flash의 non-thinking/thinking 모드로 연결됐다고 설명합니다.

출시 상태도 과장하지 않는 편이 안전합니다. 4월 공식 글은 V4를 preview로 소개했고 7월 31일 변경 기록은 V4 Pro의 official release가 추후 이어질 것이라고 밝혔습니다. 현재 quick start에는 이미 0813 버전이 표시되지만, 이번에 확인한 공식 페이지에는 Pro를 명시적으로 GA라고 부르는 별도 공지가 없습니다. “현재 API로 호출 가능”은 확인됐지만 “GA”까지 덧붙일 필요는 없습니다.

현재 요금으로 한 번의 작업을 계산하기

공식 직결 API의 100만 tokens당 Pro 요금은 다음과 같습니다.

  • 캐시 적중 입력: $0.003625
  • 캐시 미적중 입력: $0.435
  • 출력: $0.87

고정 자료 60만 tokens가 캐시에 적중하고, 새로운 입력 20만 tokens와 출력 3만 tokens가 발생한 코드 저장소 분석을 예로 들면:

0.6 × $0.003625 + 0.2 × $0.435 + 0.03 × $0.87 = $0.115275

이 값은 2026년 8월 13일 가격표의 산술 결과입니다. 세금, 외부 도구, 재시도, 사람의 수정, 제3자 gateway 마진은 포함하지 않습니다. 더구나 DeepSeek는 같은 페이지에서 API 요금을 크게 올릴 계획이라고 밝혔지만 확정 새 가격은 아직 제시하지 않았습니다. 현재 단가를 장기 예산에 고정하지 마세요.

낮은 캐시 단가도 전체 prompt의 자동 할인을 뜻하지 않습니다. 고정 system prompt, 저장소 지도, 변하지 않는 문서 묶음은 안정적인 prefix로 두고, 새 사용자 지시, tool result, 누적 대화는 분리합니다. 실제 usage의 cached tokens를 확인해야 절감 효과를 예산에 반영할 수 있습니다.

그리고 요청당 가격보다 다음 지표가 더 중요합니다.

채택 가능한 작업당 비용 = 모든 시도의 입력·캐시·출력·도구·재시도 비용 / 검수를 통과한 작업 수

Python으로 최소 요청 보내기

DeepSeek 첫 API 호출 문서에 따라 OpenAI SDK를 사용할 수 있습니다. API key는 코드가 아니라 환경 변수에 둡니다.

python
import os from openai import OpenAI client = OpenAI( api_key=os.environ["DEEPSEEK_API_KEY"], base_url="https://api.deepseek.com", ) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[ {"role": "system", "content": "코드 변경을 보수적으로 검토하세요."}, {"role": "user", "content": "이 마이그레이션 계획의 롤백 위험을 찾아 주세요."}, ], reasoning_effort="high", extra_body={"thinking": {"type": "enabled"}}, stream=False, ) print(response.choices[0].message.content)

짧은 분류, 추출, 형식 변환은 non-thinking으로 품질과 비용을 비교할 수 있습니다.

python
extra_body={"thinking": {"type": "disabled"}}

smoke test의 통과 기준을 HTTP 200으로 끝내지 마세요. 최종 content가 비어 있지 않은지, model과 usage를 기록하는지, timeout과 오류를 처리하는지, API key와 민감한 prompt를 일반 로그에 남기지 않는지 확인합니다.

thinking mode에서 무시되는 설정

공식 thinking mode 문서에 따르면 기본값은 thinking 활성화, effort high입니다. 실제 강도는 low, high, max이고 mediumxhighhigh로 매핑됩니다.

thinking 중에는 temperature, top_p, presence_penalty, frequency_penalty가 효과가 없습니다. 호환성을 위해 오류가 나지 않을 수 있어 오래된 설정이 작동하는 것처럼 보입니다. 단순 작업이면 thinking을 끄고, 복잡한 작업이면 effort를 조정하세요.

도구를 사용하는 Agent에는 더 중요한 규칙이 있습니다. 모델이 reasoning_content, content, tool_calls를 함께 반환했다면, 도구 실행 후 다음 요청에 assistant message 전체를 유지하고 그 뒤에 role: tool 결과를 붙여야 합니다. reasoning_content를 빼면 thinking tool loop에서 HTTP 400이 발생할 수 있습니다.

thinking 모드에서 작동하는 reasoning 설정과 효과 없는 sampling 파라미터
thinking 모드에서 작동하는 reasoning 설정과 효과 없는 sampling 파라미터

SDK가 반환한 message object를 그대로 history에 추가하는 방식이 가장 안전합니다. 공식 tool calls 가이드의 strict mode는 /beta와 제한된 JSON Schema를 사용하는 별도 Beta 기능입니다. 모든 schema를 보장한다고 해석하면 안 됩니다.

1M 컨텍스트를 매번 채우지 마세요

100만 컨텍스트는 작업 창의 상한이고 384K는 최대 출력입니다. 둘은 다른 제한이며, 전체 모노레포를 매 요청마다 넣으라는 권장값도 아닙니다.

큰 미캐시 입력은 비용과 prefill을 늘리고 관련 없는 파일은 판단을 흐릴 수 있습니다. 먼저 검색으로 현재 작업에 필요한 코드와 문서를 선택하고, 검수 실패가 정보 부족 때문일 때만 범위를 넓히세요. 첫 token 속도보다 채택 가능한 결과까지의 시간, retry와 사람 개입을 측정합니다.

1M 컨텍스트 상한과 384K 출력 상한을 권장 사용량과 구분한 도식
1M 컨텍스트 상한과 384K 출력 상한을 권장 사용량과 구분한 도식

Pro가 Flash보다 비싼 값을 할 때

확인한 가격표에서 Pro의 미캐시 입력과 출력은 Flash의 약 3배입니다. 작업 실패 비용으로 첫 후보를 정하세요.

작업첫 후보Pro를 채택할 증거
짧은 대화, 추출, 정형 변환V4 Flash중요한 형식·사실 오류가 줄어듦
여러 파일 계획과 복잡한 디버깅V4 Pro누락, 재시도, 수동 개입이 줄어듦
비싼 도구를 쓰는 긴 체인동일 조건 Pro 테스트채택률과 작업당 총비용이 개선됨
명확한 validator가 있는 대량 처리V4 FlashPro가 전체 채택 비용을 낮출 때만 전환

Pro의 benchmark를 Flash 성능으로 사용하지 마세요. 더 넓은 후보를 비교한다면 한국어 DeepSeek V4 Flash vs Kimi K3 vs GLM-5.2 비교가 별도의 선택 문제를 다룹니다.

10~30개의 실제 과제를 같은 파일, tool 권한, timeout, retry budget, 검수 조건으로 실행하세요. 캐시·미캐시 입력, 출력, 전체 시간, 사람 개입을 기록하고 한 번의 멋진 데모가 아니라 채택 결과당 비용으로 결정합니다.

도입 직전 공식 가격표변경 기록을 다시 확인하세요. 안정적인 ID는 코드를 유지해 주지만 뒤의 버전, 가격, 무료 여부를 고정하지는 않습니다.