A 1 de octubre de 2026, de estos tres modelos solo puedes llamar a dos: Claude Sonnet 5.5 (claude-sonnet-5-5) y Claude Opus 5.5 (claude-opus-5-5). Gemini 4 Argon, que Google anunció el 30 de septiembre, llega por ahora únicamente a los equipos de ciberdefensa admitidos en su programa Fairwind: no tiene ID de modelo público ni fecha de apertura, y no figura en la documentación ni en la tabla de precios de la API de Gemini. La elección real de hoy es entre los dos Claude, y Argon queda como una prueba pendiente:
- Sonnet 5.5 (2 USD por millón de tokens de entrada y 10 USD de salida) para tareas bien acotadas: generar código, analizar datos, redactar, usar herramientas.
- Opus 5.5 (4 y 20 USD) para trabajo largo y abierto: agentes de programación que corren durante horas, refactorizaciones grandes, uso del ordenador.
- Gemini 4 Argon saldrá a 2 y 10 USD como precio de lanzamiento, lo mismo que Sonnet 5.5, y pasará después a 4 y 20 USD, lo mismo que Opus 5.5. En Vals Index, la única clasificación que mide a los tres con la misma escala, va primero con un 68,9 %, dos puntos por delante de dos Claude prácticamente empatados.
Las cifras de rendimiento que aparecen más abajo las publican Google, Anthropic y Vals; cada una va acompañada de quién la midió y en qué condiciones, porque eso cambia lo que permite afirmar.
Qué se puede usar hoy: Opus 5.5 y Sonnet 5.5; Argon, solo en Fairwind
| Gemini 4 Argon | Claude Opus 5.5 | Claude Sonnet 5.5 | |
|---|---|---|---|
| Anuncio o lanzamiento | 30 de septiembre de 2026 (anuncio) | 22 de septiembre de 2026 | 28 de septiembre de 2026 |
| Quién puede usarlo | Equipos de ciberdefensa del programa Fairwind | Todos los clientes de la API de Claude | Todos los clientes de la API de Claude |
| ID de modelo | Sin publicar | claude-opus-5-5 | claude-sonnet-5-5 |
| Otras plataformas | Sin publicar | Amazon Bedrock (anthropic.claude-opus-5-5), Google Cloud, Microsoft Foundry, Claude Platform on AWS | Amazon Bedrock (anthropic.claude-sonnet-5-5), Google Cloud, Microsoft Foundry, Claude Platform on AWS |
| Ventana de contexto | Sin publicar | 1 millón de tokens | 1 millón de tokens |
| Salida máxima | 1 millón de tokens | 128.000 tokens (llamada síncrona) | 128.000 tokens (llamada síncrona) |
| Entrada y salida | Lista de modalidades sin publicar | Texto e imágenes; salida de texto | Texto e imágenes; salida de texto |
| Latencia según el fabricante | Sin publicar | Moderada | Rápida |
| Effort por defecto | Sin publicar | medium | high |
En el anuncio de Google, Argon se está desplegando entre un grupo de equipos de ciberdefensa a través de Fairwind, y la compañía dice que lo abrirá a desarrolladores, empresas y consumidores «lo antes posible», empezando por los clientes de pago de la API y los suscriptores de Google AI Ultra. No da fecha. Tampoco hay todavía ventana de contexto, límites de uso ni fecha de corte de conocimiento; el único dato técnico concreto es el límite de salida, que sube de 64.000 tokens a 1 millón. El nombre oficial es Gemini 4 Argon: «Gemini 4 Pro» era el que circulaba en las filtraciones previas y no corresponde a ningún modelo anunciado.
Si hoy necesitas un modelo de Google en producción, el más reciente de la lista de modelos de la API de Gemini es Gemini 3.8 Flash (gemini-3.8-flash), con nivel gratuito y un precio de pago de 0,75 USD de entrada y 3,75 USD de salida por millón de tokens hasta el 31 de diciembre de 2026, que sube a 1,50 y 7,50 USD desde el 1 de enero de 2027. Su ficha completa está en Gemini 3.8 Flash API: ID, precios, límites y migración.
Los datos de los dos Claude salen de la tabla de modelos de Anthropic. Que una nube los ofrezca no garantiza que tu cuenta o tu región ya los tengan activados: compruébalo en el catálogo de esa consola antes de dar por hecho el acceso.
Qué Claude usar mientras Argon siga cerrado
La regla corta: empieza por Sonnet 5.5 si la tarea tiene un alcance claro, y pasa a Opus 5.5 cuando el trabajo sea largo, abierto o dependa de mucha autonomía.

| Tu caso | Empieza por | Por qué |
|---|---|---|
| Generación de código con alcance definido, análisis de datos, redacción, comprensión de imágenes, agentes que encadenan herramientas | Sonnet 5.5 | Mitad de precio por token, latencia «rápida» y resultados casi iguales a Opus 5.5 en trabajo profesional general |
| Agentes de programación autónomos de varias horas, refactorizaciones a gran escala, ingeniería de sistemas compleja, flujos con mucha visión, uso del ordenador | Opus 5.5 | Son los usos que Anthropic le asigna, y donde mantiene ventaja en sus propias pruebas de código difícil |
| Ya usas Opus 5.5 y te preocupa la factura | Opus 5.5 con otro nivel de effort | Anthropic indica que ajustar effort suele dar más resultado que cambiar de modelo |
| Necesitas más de 128.000 tokens de salida en una sola respuesta, o tu trabajo se parece a las pruebas donde Argon saca más distancia | El Claude que te sirva hoy, con una nueva prueba cuando Argon se abra | Hoy no hay forma de llamar a Argon fuera de Fairwind |
Esta regla se apoya en dos fuentes de Anthropic que conviene leer juntas. La guía de elección de modelo dice que la mayoría de las cargas de trabajo empiezan por Opus 5.5 y reserva Sonnet 5.5 para generación de código, análisis de datos, creación de contenido, comprensión visual y uso de herramientas en agentes. El anuncio de Sonnet 5.5 lo presenta para «tareas cotidianas bien acotadas» y añade que, en trabajo complejo y abierto, Opus 5.5 «sigue siendo claramente más fuerte». Las dos coinciden en el reparto; la diferencia está en por cuál empezar, y ahí el precio inclina la balanza: Sonnet 5.5 cuesta la mitad por token y, en Vals Index, queda a 0,07 puntos de Opus 5.5 con dos tercios de su coste por prueba.
Si la duda es cuánto effort poner en Opus 5.5 antes de plantearte el cambio, Effort en Claude Opus 5.5: qué nivel elegir y cómo medir si compensa lo desarrolla. Y si en la decisión entran también Fable 5.1 o Haiku, la comparación dentro de la gama está en Claude Opus 5.5 o Fable 5.1: cuál elegir y cuánto cuesta en la API.
Antes de cambiar el nombre del modelo en código que ya funciona, ten en cuenta que los dos Claude 5.5 rechazan con un error 400 el uso forzado de herramientas (tool_choice con any o tool) y la herramienta de ordenador antigua computer_20251124 en la API de Claude y en Google Cloud. Ninguno acepta thinking: {"type": "disabled"}; Sonnet 5.5 admite en su lugar thinking: {"type": "between_tools"}, que suprime el pensamiento inicial y solo funciona con effort low, medium o high. El detalle de cada cambio está en Claude Opus 5.5: precio, disponibilidad y qué falla al migrar.
Precios: Argon saldrá al precio de Sonnet 5.5 y pasará al de Opus 5.5
Precios oficiales en dólares por millón de tokens, sin impuestos. Los de Claude son los de la API directa según la página de precios de Anthropic; los de Argon son los anunciados por Google, que hoy nadie fuera de Fairwind puede pagar.
| Concepto | Sonnet 5.5 | Opus 5.5 | Argon, lanzamiento | Argon, estándar |
|---|---|---|---|---|
| Entrada | 2 USD | 4 USD | 2 USD | 4 USD |
| Salida | 10 USD | 20 USD | 10 USD | 20 USD |
| Lectura de caché | 0,20 USD | 0,20 USD | 0,10 USD (95 % menos que la entrada) | Sin publicar |
| Escritura de caché (5 minutos) | 2,50 USD | 5 USD | Sin publicar | Sin publicar |
| Escritura de caché (1 hora) | 4 USD | 8 USD | Sin publicar | Sin publicar |
| Batch, entrada / salida | 1 / 5 USD | 2 / 10 USD | Sin publicar | Sin publicar |
Tres cosas se ven en la tabla. El precio de lanzamiento de Argon coincide con el precio estándar de Sonnet 5.5, y el precio que Google aplicará cuando termine ese periodo coincide con el de Opus 5.5; el anuncio no dice cuándo termina. La lectura de caché cuesta lo mismo en los dos Claude, 0,20 USD, de modo que en trabajos con mucho contexto repetido la distancia entre ambos se estrecha. Y solo Opus 5.5 tiene modo rápido, en vista previa de investigación y solo en la API de Claude, a 8 y 40 USD. En Bedrock y Google Cloud los precios los fija cada nube, y la inferencia limitada a EE. UU. multiplica la tarifa por 1,1.
Ejemplo A: mismos tokens, sin caché
Supón una tarea con 100.000 tokens de entrada y 20.000 de salida. El coste es entrada en millones × precio de entrada + salida en millones × precio de salida:
| Modelo | Cálculo | Coste |
|---|---|---|
| Sonnet 5.5 | 0,1 × 2 + 0,02 × 10 | 0,40 USD |
| Opus 5.5 | 0,1 × 4 + 0,02 × 20 | 0,80 USD |
| Argon, precio de lanzamiento | 0,1 × 2 + 0,02 × 10 | 0,40 USD |
| Argon, precio estándar | 0,1 × 4 + 0,02 × 20 | 0,80 USD |
Ejemplo B: un turno de agente con mucha caché
Ahora un turno con 200.000 tokens leídos de caché, 20.000 de entrada nueva y 5.000 de salida:
| Modelo | Cálculo | Coste |
|---|---|---|
| Sonnet 5.5 | 0,2 × 0,20 + 0,02 × 2 + 0,005 × 10 = 0,04 + 0,04 + 0,05 | 0,13 USD |
| Opus 5.5 | 0,2 × 0,20 + 0,02 × 4 + 0,005 × 20 = 0,04 + 0,08 + 0,10 | 0,22 USD |
| Argon, precio de lanzamiento | 0,2 × 0,10 + 0,02 × 2 + 0,005 × 10 = 0,02 + 0,04 + 0,05 | 0,11 USD |

Aquí Sonnet 5.5 no cuesta la mitad que Opus 5.5, sino un 41 % menos (0,09 USD de diferencia sobre 0,22 USD), porque la lectura de caché vale igual en los dos.
Los dos ejemplos suponen que los tres modelos consumen exactamente los mismos tokens, y eso no ocurre: el recuento cambia con el tokenizador, el nivel de effort y el pensamiento, que se factura como salida. Tampoco incluyen escrituras de caché, herramientas ni impuestos, y las filas de Argon son hipotéticas mientras no se pueda llamar. Sirven para sustituir tus propias cifras: toma del campo de uso de una respuesta real los tokens de entrada, de caché y de salida, y repite la cuenta con cada tarifa. Cómo leer ese campo en cada proveedor sin duplicar el pensamiento está en Tokens de razonamiento: cómo evitar contarlos dos veces en Gemini, OpenAI y Claude.
Qué dicen las pruebas y quién midió cada cifra
Hay tres juegos de cifras y cada uno compara una pareja distinta. Solo Vals mide a los tres; Google compara a Argon con Opus 5.5 y deja fuera a Sonnet 5.5; Anthropic compara a sus dos modelos entre sí. Ningún fabricante ha publicado un cara a cara entre Argon y Sonnet 5.5.
Vals Index: los tres en la misma escala
Vals Index es una clasificación independiente que pondera tareas de finanzas, programación, derecho y fiscalidad según su peso económico. Versión 2.1, actualizada el 30 de septiembre de 2026:
| Modelo | Puntuación | Coste por prueba | Tiempo |
|---|---|---|---|
| Gemini 4 Argon | 68,90 % | 15,68 USD | 46 min 33 s |
| Claude Sonnet 5.5 | 67,04 % | 21,34 USD | 1 h 18 min |
| Claude Opus 5.5 | 66,97 % | 32,14 USD | 1 h 19 min |
Lo que permite afirmar: en este conjunto de tareas, Argon va unos dos puntos por delante y termina antes y por menos dinero; Sonnet 5.5 y Opus 5.5 están empatados a efectos prácticos (0,07 puntos), con Sonnet a unos dos tercios del coste por prueba de Opus. Lo que no permite afirmar: que ese orden se mantenga en tu trabajo ni que sea estable. La tabla cambia cuando Vals repite ejecuciones, y una diferencia de 0,07 puntos entre Sonnet 5.5 y Opus 5.5 puede invertirse en la siguiente, así que conviene citar estas cifras con su fecha. Vals tampoco indica qué tarifa aplica al coste de Argon; si es la de lanzamiento, ese coste subirá cuando entre el precio estándar.
La tabla de Google: Argon frente a Opus 5.5
Google publica en la página de modelos Gemini una tabla con Argon y Opus 5.5 en las mismas filas. Todas las cifras son porcentajes.
| Prueba | Gemini 4 Argon | Claude Opus 5.5 |
|---|---|---|
| Vals Index | 68,9 | 67,0 |
| AutomationBench | 51,3 | 42,5 |
| Vals Finance Agent v2 | 65,4 | 58,6 |
| Harvey Legal Agent Benchmark | 19,6 | 3,8 |
| DeepSWE v1.1 | 77,9 | 74,2 |
| Vibe Code Bench | 91,9 | 90,3 |
| LABBench 2 | 88,8 | 73,1 |
| RiemannBench | 76,0 | 69,6 |
| GraphWalks, hasta 128k | 99,7 | 90,6 |
| GraphWalks, de 256k a 1M | 84,2 | 66,8 |
| Agent's Last Exam | 39,5 | 38,2 |
| Chartography | 71,6 | 66,3 |
| LVBench | 91,7 | 83,7 |
| CWE-bench v1 | 68,0 | 67,0 |
| FrontierSWE v2 | 55,0 | 62,3 |
| Terminal-Bench 4.0 | 57,4 | 66,4 |
| PostTrainBench | 45,3 | 49,3 |
| Terminal-Bench Science 0.1 | 57,6 | 63,3 |
Argon queda por delante en 14 de las 18 filas, con las mayores distancias en contexto largo, agentes jurídicos, biología (LABBench 2) y automatización. Opus 5.5 gana las cuatro últimas, que miden programación autónoma, trabajo en terminal e ingeniería de aprendizaje automático.
Antes de sacar conclusiones, mira cómo se construyó la tabla, que Google detalla en su nota de metodología:
- Las pruebas las eligió Google, y Argon se ejecutó con el nivel de pensamiento más alto.
- Las cifras de Opus 5.5 proceden en su mayoría de lo que publica Anthropic o de las clasificaciones públicas, con el nivel de razonamiento máximo o el mejor disponible.
- En PostTrainBench, LABBench 2, GraphWalks y LVBench, Google ejecutó por su cuenta todos los modelos. En LVBench usó un número distinto de fotogramas para cada modelo «por limitaciones de la API», así que esa fila no compara en igualdad de condiciones.
- Varias cifras de Argon (DeepSWE, Terminal-Bench 4.0, Terminal-Bench Science, Agent's Last Exam) las calculó Google, mientras que las de los demás vienen de las clasificaciones públicas.
Es una tabla de fabricante: útil para saber dónde buscar diferencias y no como veredicto.
Las cifras de Anthropic: Sonnet 5.5 frente a Opus 5.5
| Prueba | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70,6 % | 66,4 % (con effort xhigh, su mejor resultado) |
| FrontierCode 1.1 | 46,2 % con max; 52,1 % con xhigh | 54,4 % |
| CursorBench 4.0 | 55,5 % | 57,8 % |
| GDPval-AA v2.1 | 1844 | 1846 |
| AA-Briefcase v1.1 | 1811 | 1822 |
| Humanity's Last Exam (con herramientas) | 64,5 % | 67,7 % |
| OSWorld 2.1 | 80,1 % | 81,8 % |
| Chartography (sin herramientas) | 61,6 % | 64,4 % |
Sonnet 5.5 solo gana en Terminal-Bench 4.0; en el resto Opus 5.5 va por delante, con poca distancia en trabajo de oficina (GDPval-AA, AA-Briefcase) y uso del ordenador, y con más en código difícil (FrontierCode). Encaja con la regla de arriba: para lo acotado, la diferencia de calidad es pequeña y la de precio es del doble.
Dos avisos al leer estas cifras. Anthropic dice que Sonnet 5.5 genera la salida más de un 30 % más rápido y cuesta hasta un 30 % menos por tarea, pero la comparación es con Sonnet 5, su predecesor, no con Opus 5.5 ni con Gemini. Y Chartography aparece con dos valores para Opus 5.5: 64,4 % en la tabla de Anthropic y 66,3 % en la de Google. Son ejecuciones o configuraciones distintas, así que el 61,6 % de Sonnet 5.5 solo se compara con el 64,4 %, y el 71,6 % de Argon solo con el 66,3 %.
Cuándo merece la pena volver a probar Argon
La señal para retomarlo es que Gemini 4 Argon aparezca con su ID en la lista de modelos y en la tabla de precios de la API de Gemini. Hasta entonces no hay nada que probar. Cuando ocurra, merece la pena dedicarle una tarde si te encuentras en alguno de estos casos:
- Pagas Opus 5.5 por tareas parecidas a las de Vals Index (finanzas, derecho, fiscalidad, programación). Al precio de lanzamiento, Argon cuesta por token la mitad que Opus 5.5 y puntúa dos puntos más en esa clasificación.
- Trabajas con contextos muy largos. Es la fila con más distancia a favor de Argon en la tabla de Google: 84,2 % frente a 66,8 % en GraphWalks entre 256.000 y 1 millón de tokens, ejecutada por Google para ambos modelos.
- Necesitas salidas de más de 128.000 tokens en una sola respuesta. El límite anunciado de Argon es de 1 millón.
- Tus agentes releen mucho contexto en caché. La lectura de caché de lanzamiento, 0,10 USD por millón, es la mitad de los 0,20 USD de los dos Claude.
Y hay menos motivos para esperar un salto si lo tuyo es programación autónoma en terminal: en la propia tabla de Google, Opus 5.5 supera a Argon en Terminal-Bench 4.0 (66,4 % frente a 57,4 %) y en FrontierSWE v2 (62,3 % frente a 55,0 %).
Para que la prueba sirva, usa un conjunto fijo de tareas tuyas, las mismas en cada modelo, y compara el coste por tarea terminada con los tokens reales de cada respuesta, no el precio por token. Dos datos pueden cambiar el resultado y aún no se conocen: cuándo acaba el precio de lanzamiento (a 4 y 20 USD la ventaja de precio frente a Opus 5.5 desaparece) y qué límites de uso tendrá el modelo al abrirse. Tampoco está publicado cómo se comporta su API en lo que suele romper una migración, como el uso de herramientas o el control del pensamiento.
Preguntas frecuentes
¿Se puede usar Gemini 4 Argon en la API o en la app de Gemini?
A 1 de octubre de 2026, no. Solo lo reciben los equipos de ciberdefensa del programa Fairwind. Google dice que la apertura empezará por los clientes de pago de la API y los suscriptores de Google AI Ultra, sin fecha, y no ha aclarado qué otros planes de la app lo tendrán.
¿Qué modelo es más caro, Sonnet 5.5 u Opus 5.5?
Opus 5.5: 4 USD de entrada y 20 USD de salida por millón de tokens, el doble que los 2 y 10 USD de Sonnet 5.5. La excepción es la lectura de caché, que cuesta 0,20 USD en ambos.
¿Qué consume menos, Opus 5.5 o Sonnet 5.5?
En coste, Sonnet 5.5. En Vals Index completó la prueba por 21,34 USD frente a 32,14 USD de Opus 5.5, unos dos tercios, con una puntuación casi idéntica. La proporción exacta depende de tu tarea: con los mismos tokens y sin caché es la mitad; con mucha lectura de caché, la diferencia baja al 41 % del ejemplo B.
¿Gemini 4 Argon es mejor que Claude Opus 5.5?
En la tabla de Google va por delante en 14 de 18 pruebas y en Vals Index puntúa 68,9 % frente a 67,0 %. Opus 5.5 gana en Terminal-Bench 4.0, FrontierSWE v2, PostTrainBench y Terminal-Bench Science. La tabla la eligió y la montó Google, y Argon todavía no se puede probar fuera de Fairwind, así que la ventaja está publicada pero no la puedes comprobar aún con tu propio trabajo.
¿Cuánto costará Gemini 4 Argon?
El precio de lanzamiento anunciado es de 2 USD por millón de tokens de entrada y 10 USD de salida, con la entrada en caché un 95 % más barata. Después del periodo de lanzamiento serán 4 y 20 USD. Google no ha dicho cuándo termina ese periodo ni ha publicado precios de Batch o de herramientas.



