AIFreeAPI Logo

Modelos Grok en 2026: comparativa de 4.6, 4.5, 4.3 y 4.20

A
7 min readAI Model Comparison

Grok 4.6 es el candidato inicial razonable para trabajo complejo, pero 4.3 sigue siendo un control útil por su contexto de 1M, Batch y menor tarifa.

Guía para elegir una primera candidata y un control entre Grok 4.6, 4.5, 4.3 y 4.20 en la API directa

A 26 de agosto de 2026, el catálogo oficial de modelos de SpaceXAI recomienda grok-4.6 para programación y uso general. La tarifa de la API directa también mantiene grok-4.5, grok-4.3, tres rutas Grok 4.20 y el modelo especializado grok-build-0.1. No forman una escala en la que el número más alto gane siempre.

Para una aplicación compleja nueva, 4.6 es un buen punto de partida. Conviene incluir 4.3 en la misma prueba cuando importan la ventana de un millón de tokens, Batch, una tarifa inferior o una ruta sin razonamiento. Un sistema estable sobre 4.5 necesita una comparación antes de migrar, no un cambio por reflejo. Multi-Agent y Build deben justificar su papel con tareas especializadas.

Esta página compara contratos de salida de texto de la API directa de xAI. El selector de la aplicación Grok, el consumo incluido en Grok Build, la disponibilidad en Cursor y el recargo de una pasarela son contratos distintos. Que un ID figure en la documentación de la API no garantiza la misma opción en todos los planes, regiones o intermediarios.

La familia vigente, leída como rutas de ejecución

ID de la API directaContexto y razonamientoHipótesis inicial útilLímite que hay que conservar
grok-4.6500K; low, medium, high, xhighAgentes largos, código difícil y aplicaciones generales con herramientasCon un prompt de 200K, toda la solicitud pasa a la tarifa larga
grok-4.5500K; low, medium, highControl para un sistema que ya funciona bienYa no es la recomendación principal del catálogo
grok-4.31M; none, low, medium, high; BatchDocumentos grandes, procesos estructurados o solicitudes sin razonamientoUna llamada barata no equivale a una tarea aceptada barata
grok-4.20-0309-reasoning1M; razonamiento fijadoConservar o reproducir un comportamiento concreto de 4.20Un ID fechado no es el nuevo modelo general por defecto
grok-4.20-0309-non-reasoning1M; sin razonamientoSalidas verificables sensibles a la latenciaLos reintentos cambian el coste final
grok-4.20-multi-agent-03091M; investigación paralela; BetaInvestigación divisible cuyas fuentes y síntesis se puedan revisarMás agentes alteran la ejecución y el consumo total
grok-build-0.1256K; agentic codingCambios de repositorio, desarrollo web y recuperación de buildsNo es una versión general barata de 4.6

El contrato de Grok 4.6 especifica 500.000 tokens de contexto, entrada de texto e imagen, salida de texto y un corte de conocimiento del 1 de febrero de 2026. Admite Responses API, Chat Completions, function calling, Web Search, X Search y ejecución de código. El reasoning effort predeterminado es high.

Los datos actuales no aparecen por llevar «latest» en el prompt. Para hechos posteriores al corte hay que habilitar Web Search o X Search de forma explícita y probar selección de fuentes, citas, fallo de herramientas, latencia y coste de invocación.

Qué aporta 4.6 y qué no demuestra su anuncio

SpaceXAI presenta 4.6 como una ampliación de 4.5 para agentes más largos y trabajo interactivo, visual y de programación más ambicioso. El anuncio de 4.6 publica resultados donde 4.6 High supera a 4.5 High en varias evaluaciones de agentes, código y conocimiento.

Son cifras publicadas o recopiladas por el proveedor. Sirven para formular una hipótesis —por ejemplo, que 4.6 podría conservar mejor el objetivo durante muchos pasos—, pero no eligen un modelo para un repositorio, un corpus de soporte o un extractor jurídico concreto.

Ejecute 4.6 y el control con los mismos permisos, enunciado, ensamblado de contexto, esfuerzo de razonamiento, timeout y criterios de aceptación. Registre aceptación al primer intento, intervenciones, reintentos, tiempo P95, fallos de herramientas y coste de todos los intentos. La mejora debe repetirse y superar el coste de la migración.

En un despliegue estable, 4.5 funciona como línea base y como rollback. Retirarlo antes de medir 4.6 convierte cualquier diferencia en una impresión y dificulta distinguir el cambio de modelo de otros cambios del sistema.

4.3 cuesta menos por token; el umbral de 200K cambia la cuenta

El contrato de 4.3 ofrece un millón de tokens, Batch y razonamiento none, low, medium o high. Por cada millón de tokens de entrada, entrada en caché y salida, sus tarifas cortas son $1,25 / $0,20 / $2,50. En 4.6 son $2 / $0,50 / $6.

Para una solicitud sin caché con 100K de entrada y 20K de salida, sin herramientas ni reintentos:

  • 4.3: 0,1 × $1,25 + 0,02 × $2,50 = $0,175;
  • 4.6: 0,1 × $2 + 0,02 × $6 = $0,32.

Es el coste de una solicitud, no del trabajo terminado. Si 4.3 necesita dos intentos y corrección humana, mientras 4.6 pasa a la primera, la ventaja puede desaparecer. La métrica operativa suma tokens, llamadas de herramientas, reintentos y reparación humana, y divide el total por las tareas aceptadas.

La tarifa vigente tiene un corte importante: cuando el prompt llega a 200K tokens, los precios largos se aplican a toda la solicitud, no solo al exceso. 4.3 pasa a $2,50 / $0,40 / $5 y 4.6 a $4 / $1 / $12. La recuperación selectiva, la eliminación de duplicados, la caché de un prefijo común y la compactación pueden importar más que la ventana máxima anunciada.

Web Search, X Search y la ejecución de código llevan un contador separado: actualmente $5 por cada 1.000 llamadas, además de los tokens. Un agente decide cuántas invocaciones realiza, así que el presupuesto fiable sale de registros de usage ligados a resultados aceptados.

Tarifas de Grok 4.3 y 4.6, umbral de 200K y cálculo del coste total por tarea aceptada
Tarifas de Grok 4.3 y 4.6, umbral de 200K y cálculo del coste total por tarea aceptada

4.20 y Build son contratos especializados

Los tres IDs 4.20 comparten una ventana de 1M y las tarifas de tokens de 4.3, pero no la misma ejecución. Las variantes reasoning y non-reasoning fijan esos comportamientos. grok-4.20-multi-agent-0309 ejecuta agentes en paralelo para investigación profunda y aparece como Beta en su página oficial.

Multi-Agent tiene sentido cuando el problema se descompone de verdad, omitir una perspectiva sale caro y alguien puede revisar fuentes y síntesis. Compare entregables aceptados y coste total, no solo su tarifa de salida frente a una llamada de un único agente.

grok-build-0.1 es un modelo de agentic coding con 256K y tarifas cortas de $1 / $0,20 / $2. Pruébelo con ediciones de repositorio, desarrollo web, recuperación de builds y revisión de código. El uso incluido en el producto Grok Build no es intercambiable con la facturación por tokens de la API directa.

Migrar un ID antiguo sin confundir redirección con compatibilidad

La guía de retirada de mayo de 2026 redirige Grok 4 Fast, 4.1 Fast, grok-4-0709 y grok-3 a 4.3 con ajustes concretos de razonamiento. grok-code-fast-1 pasa a grok-build-0.1. La facturación sigue al modelo de destino.

Localice IDs en código, variables de entorno, servicios de configuración, colas y pasarelas. Anote el destino actual de cada alias. Use un conjunto de evaluación con entrada ordinaria, contexto cercano a 200K, fallo de herramienta, salida estructurada y rechazo de seguridad. Coloque tanto model como el esfuerzo de razonamiento en una configuración reversible y amplíe tráfico solo cuando una cohorte pequeña mantenga aceptación, latencia y coste dentro de los límites.

Seis pasos para migrar rutas Grok con inventario de alias, evaluación común, configuración reversible y rollback
Seis pasos para migrar rutas Grok con inventario de alias, evaluación común, configuración reversible y rollback

Un nombre simple o -latest puede avanzar a una versión nueva; un ID fechado permanece fijado. Para trabajo crítico suele ser más controlable combinar ID fijado, prueba de actualización planificada y un rollback conocido.

La decisión final es condicional: empiece el trabajo general complejo con 4.6; mantenga 4.3 como control de menor coste, 1M y razonamiento opcional; conserve 4.5 hasta medir la actualización; y exija a 4.20 Multi-Agent o Build 0.1 demostrar valor en sus tareas especializadas.

Si la decisión incluye otros proveedores, continúe con la comparativa de Grok 4.6, GPT-5.6 Sol y Claude Fable 5 para programación. El nombre abre la prueba; las mismas tareas, contratos explícitos y despliegue reversible deciden qué modelo permanece.