A 26 de agosto de 2026, la API oficial de DeepSeek ofrece tres rutas actuales: deepseek-v4-flash, deepseek-v4-pro y la experimental deepseek-v4-flash-vision-exp. Comparar únicamente R1 y V3 ya no basta para elegir el ID de un proyecto nuevo.
Una regla inicial útil es empezar el texto, las salidas estructuradas y los agentes habituales en V4 Flash. V4 Pro entra en la evaluación cuando el código complejo, el razonamiento difícil o las cadenas largas de herramientas muestran una diferencia de aceptación que puede pagar su mayor tarifa. Vision Exp solo debe añadirse cuando hay imágenes reales en la entrada y la aplicación puede asumir una dependencia experimental.
El chat web o la app de DeepSeek, la API oficial, los pesos abiertos y una ruta con el mismo nombre en un proveedor externo son contratos distintos. El acceso o el precio de una superficie no demuestra la versión, los límites ni el SLA de otra.
Qué representa cada ID actual
La guía oficial de primera llamada indica que los dos IDs de texto apuntan ahora a V4-Flash-0731 y V4-Pro-0813. Vision Exp se incorporó a la plataforma API el 21 de agosto como modelo experimental.
| ID de la API alojada | Primer caso razonable | Límite que cambia la decisión |
|---|---|---|
deepseek-v4-flash | Conversación, extracción, transformación, JSON, código cotidiano y agentes sensibles al coste | Pro puede aportar una diferencia en conocimiento difícil y agentes de larga duración; hay que medirla |
deepseek-v4-pro | Cambios de código complejos, alto coste de error, herramientas de varios pasos y trabajo profesional difícil | Sus tarifas de tokens son aproximadamente 3 veces las de Flash en la misma franja y estado de caché |
deepseek-v4-flash-vision-exp | Capturas, gráficos, documentos escaneados y agentes que necesitan estado visual | Requiere validación, seguimiento de versión y alternativa por su estado experimental |
Según el registro de cambios de DeepSeek, V4 Pro alcanzó disponibilidad general en app, web y API el 13 de agosto. Vision Exp, en cambio, sigue siendo una ruta experimental de API. Esa diferencia operativa importa más que una clasificación genérica de rendimiento.
El contexto de 1M no decide entre Flash y Pro
La tabla oficial de modelos y precios publica para los tres un contexto de un millón de tokens y una salida máxima de 384.000 tokens. También enumera JSON Output, Tool Calls, Responses API y una interfaz compatible con Anthropic. FIM funciona en los dos modelos de texto solo sin thinking; Vision Exp no lo admite.
Por tanto, necesitar un contexto largo no convierte a Pro en ganador automático. Una prueba útil comprueba si el modelo recupera la evidencia correcta, mantiene instrucciones al final de la entrada, conserva el estado de herramientas y limita la respuesta. Aceptar muchos tokens no garantiza usarlos bien ni de forma económica.
Los pesos abiertos constituyen otra decisión. El repositorio oficial V4 describe Pro como MoE de 1,6T parámetros totales y 49B activos, y Flash como 284B totales y 13B activos; ambos tienen licencia MIT. Esto permite estudiar un despliegue propio, pero no garantiza que una cuantización, GPU o servidor concreto reproduzca la latencia, calidad o comportamiento de herramientas de la API alojada.
El precio real tiene cuatro columnas
DeepSeek aplica tarifa punta entre 01:00–04:00 y 06:00–10:00 UTC, de lunes a viernes. El resto del tiempo es valle y cuesta la mitad. Mantener UTC evita errores con los cambios estacionales de hora en España.
Estos son los precios oficiales en USD por millón de tokens comprobados el 26 de agosto de 2026:
| Modelo | Franja | Entrada con acierto de caché | Entrada con fallo de caché | Salida |
|---|---|---|---|---|
| Flash / Vision Exp | Valle | $0.007 | $0.22 | $0.66 |
| Flash / Vision Exp | Punta | $0.014 | $0.44 | $1.32 |
| Pro | Valle | $0.022 | $0.66 | $1.98 |
| Pro | Punta | $0.044 | $1.32 | $3.96 |
Una afirmación como «desde $0.007» no representa una carga si la mayoría del contexto falla la caché y la salida es larga. Con 400.000 tokens de entrada sin caché y 40.000 de salida en horario valle, Flash cuesta aproximadamente $0.1144 y Pro $0.3432.
Esa comparación sigue siendo coste por llamada, no coste por resultado aprobado. Si Pro evita reintentos y reparación humana, puede ganar en una tarea difícil. Si ambos pasan lo mismo, la diferencia de precio no tiene un retorno demostrado.
El esfuerzo de razonamiento es una segunda variable
V4 Flash y V4 Pro permiten desactivar thinking o usar esfuerzo low, high y max. El contrato oficial de Thinking Mode lo activa por defecto en high; los valores de compatibilidad medium y xhigh se asignan actualmente a high.
La comparación debe cambiar una variable cada vez. Primero se busca el menor esfuerzo con el que Flash satisface la aceptación. Después se compara Pro con el mismo esfuerzo. Enfrentar Flash-low a Pro-max no permite atribuir la diferencia al modelo.
Thinking también cambia el cliente: temperature, top_p, presence_penalty y frequency_penalty se ignoran. En conversaciones con tools hay que devolver reasoning_content en las peticiones siguientes según el formato oficial, incluso si una ronda no llamó a una herramienta; omitirlo puede provocar un 400.
Vision Exp es una decisión de entrada y estabilidad
La guía Vision acepta JPEG, PNG, GIF y WebP mediante base64, URL externa o Files API. Los modelos normales Flash y Pro rechazan imágenes con un 400.
Vision Exp es candidato para diagnosticar una captura de interfaz, interpretar un gráfico, extraer información de un escaneo o coordinar un agente con estado visual. Para llevarlo a un flujo importante conviene validar campos críticos con reglas o esquemas, registrar la versión observada, mantener una ruta de texto cuando la imagen sea opcional y vigilar cambios de límites.
Las imágenes se convierten en tokens de entrada. La regla actual limita el resultado del redimensionado a 384 tokens por imagen, pero siguen existiendo límites distintos para archivo, cuerpo de petición, número de imágenes y dimensiones. Texto pequeño, tablas densas y orden de varias imágenes necesitan muestras propias.
R1 y V3.2 explican el linaje, no el ID por defecto

R1 conserva valor histórico y de investigación; V3.2 sigue apareciendo en pesos abiertos y entornos controlados. Sin embargo, al presentar V4, DeepSeek llevó deepseek-chat y deepseek-reasoner a una ruta de retirada y los vinculó temporalmente a los modos sin thinking y con thinking de V4 Flash.
En código nuevo es más claro usar IDs actuales. Una migración debe registrar proveedor, base URL, versión efectiva, campos soportados y resultado de tareas representativas. Un gateway puede conservar un alias antiguo o asignarlo a una instantánea diferente de la API oficial.
Una evaluación que termina, no un ranking infinito

Prepare unas catorce tareas: seis habituales, cuatro difíciles, dos fallos de herramienta y dos límites de contexto o imagen. Use los mismos prompts, tools, esfuerzo y criterios. Registre aceptación inicial y final, tokens de entrada/razonamiento/salida, caché, latencia, reintentos, corrección humana y coste por resultado aprobado.
Si Flash supera todos los casos críticos, detenga la comparación ahí. Si Pro solo mejora una clase difícil, enrute únicamente esa clase. Si la imagen no es necesaria, evite la dependencia experimental. Para profundizar en el buque insignia, puede continuar con la guía de DeepSeek V4 Pro API.
La elección sostenible no es un campeón permanente: es la configuración de menor coste que cumple de forma repetida los criterios reales, con Pro y la visión experimental reservados para mejoras observables.



