
GPT-5.5 vs Gemini 3.1 Pro: la comparativa honesta para quienes construimos
GPT-5.5 es el mejor agente de ingeniería: gana en código de terminal y multiarchivo, orquestación de herramientas y recall real a 1M tokens (74% vs 26.3%). Gemini 3.1 Pro es la opción de valor y razonamiento: ~2.5x más barato, fuerte en ciencia, programación competitiva y audio más video nativos. Elige por tarea.
¿Por qué solo estos dos ahora mismo?
Si me preguntas cuál es el mejor modelo para escribir código hoy, la respuesta técnica sería el Claude Fable 5 de Anthropic: encabeza las tablas de coding con un 80.3% en SWE-Bench Pro. Normalmente estaría en esta pelea. Pero no puedo usarlo, y tú tampoco.
El 12 de junio de 2026, una directiva de control de exportaciones del gobierno de Estados Unidos suspendió Fable 5 y Mythos 5 para cualquier extranjero. Como la nacionalidad no se puede verificar a nivel de API, Anthropic desactivó ambos modelos para todos sus clientes en el mundo, y a finales de junio de 2026 siguen offline sin restauración confirmada (nota de Anthropic). Lo dejo ahí: este post no va de Fable.
Va de los dos modelos frontera que de verdad puedes usar hoy desde Puebla, desde donde sea: GPT-5.5 de OpenAI y Gemini 3.1 Pro de Google. Soy ingeniero, los corro en producción, y esta es la comparativa honesta — dónde gana cada uno y cómo yo decido cuál usar para cada tarea.
Conoce a los dos: GPT-5.5 y Gemini 3.1 Pro
GPT-5.5: de OpenAI, lanzado el 23 de abril de 2026. Potencia ChatGPT y Codex (la herramienta de coding agéntico de OpenAI). Contexto de 1,000,000 de tokens (400,000 dentro de Codex) y un max output de 128K tokens. Detalles en el anuncio de OpenAI.
Gemini 3.1 Pro: de Google, lanzado en preview el 19 de febrero de 2026. Disponible en Gemini API / AI Studio, Gemini CLI, Vertex AI, Gemini Enterprise, la app de Gemini y NotebookLM. Contexto de 1,000,000 de tokens y max output de 64K. Y aquí está su gran diferenciador: es nativamente multimodal — acepta texto, imagen, audio y video de entrada. El anuncio de Google tiene el detalle.
Las credenciales de Gemini en su lanzamiento no son menores: ARC-AGI-2 en 77.1% (más del doble que Gemini 3 Pro), GPQA Diamond en 94.3% (un récord), y encabezó 13 de 16 benchmarks rastreados al salir.
Los dos son modelos frontera de verdad. El resto del post es encontrar dónde gana cada uno honestamente.
¿Cuál escribe y entrega mejor código?
Aquí es donde GPT-5.5 le saca ventaja. Las comparativas de benchmark de terceros reportan números que están bien alineados entre fuentes:
- SWE-Bench Pro — el benchmark más difícil, de resolución multiarchivo — GPT-5.5 con 58.6% vs Gemini con 54.2% (+4.4).
- SWE-Bench Verified — distinto y más fácil, ojo: no es lo mismo que el Pro — GPT-5.5 con 82.6% vs Gemini con 80.6% (+2.0).
- Terminal-Bench 2.0 — GPT-5.5 con 82.7% vs Gemini con 68.5% (+14.2). Este es el hueco más grande en coding, y es justo donde más importa: flujos agénticos reales de CLI y terminal.
Pero no descartes a Gemini en código. En programación competitiva, Gemini reporta ~2,887 Elo en LiveCodeBench Pro (GPT-5.5 no publica este número) — una fortaleza genuina, distinta de la ingeniería agéntica.
Para coding agéntico en producción y flujos estilo terminal/Codex, GPT-5.5 es el que yo agarro sin pensarlo. La brecha de Terminal-Bench se siente real cuando el agente tiene que encadenar comandos, leer salidas y corregir. Para generación de código en bruto, Gemini no se queda atrás.
Coding head-to-head (benchmarks reportados)
¿Quién razona mejor — y quién ve y escucha?
Este es el terreno de Gemini, y aquí lo juego justo.
En razonamiento científico, GPQA Diamond es prácticamente un empate: Gemini 94.3% vs GPT-5.5 93.6%. Llamémoslo parejo. Donde Gemini sí abre distancia es en ARC-AGI-2 con 77.1% (más del doble que su predecesor). En navegación web, Gemini reporta 85.9% en BrowseComp — otra fortaleza suya.
Y el diferenciador que ningún benchmark le quita: Gemini 3.1 Pro es nativamente multimodal — acepta audio y video de entrada, no solo texto e imagen. En el brief, GPT-5.5 no tiene una historia equivalente de video de entrada.
Si tu producto razona sobre ciencia, navega la web, o ingiere audio/video, Gemini es el ajuste natural. No es que GPT-5.5 no razone — empatan en GPQA — es que cuando el input deja de ser solo texto, Gemini es el único que entra a la cancha.
¿Cuánto cuesta realmente cada uno?
Aquí Gemini gana sin discusión. Los precios verificados:
GPT-5.5: $5 input / $30 output por 1M (Standard, ≤200K de contexto). GPT-5.5 Pro sube a $30/$180. Batch ~$2.50/$15.
Gemini 3.1 Pro: $2 input / $12 output por 1M (≤200K), subiendo a $4/$18 arriba de 200K. Batch ~$1/$6.
En síntesis, Gemini es ~2.5x más barato en cada tier de precio. El ejemplo concreto que viene en las cuentas: a 100M de tokens de output al mes, Gemini sale en ~$1,200 vs ~$3,000 de GPT-5.5.
A escala, ese delta de ~$1,800 al mes es dinero real. El costo solo puede decidir las rutas de alto volumen y bajo riesgo. Si quieres ver cómo hago estas cuentas por tokens, lo desgloso en cuánto cuesta integrar IA en tu app.
Precio de output por 1M de tokens (≤200K contexto)
¿Ambos dicen 1M de contexto — pero de verdad lo recuerdan?
Esta es la trampa más importante del post, y la que más gente pasa por alto.
Los dos anuncian ventanas de contexto de 1,000,000 de tokens. Suena igual. No lo es. En MRCR v2 — retrieval real al contexto completo de 1M — GPT-5.5 recuerda 74.0% vs 26.3% de Gemini. Una brecha de 47.7 puntos. La ventana anunciada no es lo mismo que el recall confiable.
Hay más asimetrías que importan para builders:
- Max output: GPT-5.5 da 128K vs 64K de Gemini. Y la ventana de Codex de GPT-5.5 es de 400K.
- Orquestación de herramientas: GPT-5.5 con 75.3% en MCP Atlas.
- Eficiencia de tokens: GPT-5.5 usa ~40% menos tokens de OUTPUT que GPT-5.4 en las mismas tareas de Codex, lo que recorta la brecha de costo por tarea en trabajo de coding.
Si tu carga de trabajo de verdad llena el contexto — repos grandes, documentos largos, agentes profundos — el recall es la especificación que importa, no el número de la caja. Y aquí GPT-5.5 está en otra liga. Anunciar 1M y recordar 26.3% de ese 1M no es lo mismo que prometerlo.
La trampa del contexto a 1M
Preguntas frecuentes: respuestas rápidas para builders
¿Cuál es mejor para una herramienta de coding agéntico? GPT-5.5 — lidera Terminal-Bench (82.7% vs 68.5%) y SWE-Bench Pro (58.6% vs 54.2%).
¿Cuál es más barato? Gemini 3.1 Pro, ~2.5x en cada tier ($12 vs $30 de output por 1M).
¿Cuál maneja audio/video de entrada? Solo Gemini 3.1 Pro es nativamente multimodal con audio y video de entrada.
¿Ambos dicen 1M de contexto — es lo mismo? No. El recall a 1M es 74% (GPT-5.5) vs 26.3% (Gemini); solo GPT-5.5 recuerda de forma confiable a lo largo de toda la ventana.
¿Por qué no está aquí Claude Fable 5? Está suspendido bajo una directiva de control de exportaciones de EE.UU. y offline para todos los clientes a finales de junio de 2026. Si quieres ver cómo se compara GPT-5.5 con el ahora suspendido Fable 5, lo cubro en GPT-5.5 vs Claude Fable 5.
¿Mejor para razonamiento científico? Prácticamente empatados en GPQA (94.3% vs 93.6%), con Gemini adelante en ARC-AGI-2 (77.1%).
El veredicto: enruta por tarea
Después de correr ambos, no tengo un favorito único. Tengo un mapa.
Elige GPT-5.5 para: coding agéntico/terminal, resolución multiarchivo, recall real de contexto largo, orquestación de herramientas, output más grande de 128K, y eficiencia de tokens. Es el agente de ingeniería más fuerte.
Elige Gemini 3.1 Pro para: costo (~2.5x más barato), razonamiento científico, programación competitiva, navegación web, y audio+video nativos. Es la opción de valor + razonamiento + multimodal.
Dónde gana cada uno
GPT-5.5
- Coding agéntico y de terminal (Terminal-Bench 82.7%)
- Resolución multiarchivo (SWE-Bench Pro 58.6%)
- Recall real a 1M (74% vs 26.3%)
- Orquestación de herramientas (MCP Atlas 75.3%)
- Max output más grande (128K)
Gemini 3.1 Pro
- Costo ~2.5x más barato ($12 vs $30 output)
- Razonamiento científico (ARC-AGI-2 77.1%)
- Programación competitiva (LiveCodeBench)
- Navegación web (BrowseComp 85.9%)
- Multimodal nativo: audio + video de entrada
Yo no elijo uno para todo — enruto. Ingeniería pesada y agentes de contexto largo van a GPT-5.5; alto volumen, razonamiento, browsing y multimodal van a Gemini. Si te interesa el patrón de routing y topes de costo en producción, lo explico en LLM en producción, y tengo más guías en agentes de IA.
Lo último, de builder a builder: pruébalo en tu tarea, no en el leaderboard. El modelo correcto no es el que gana el benchmark de moda — es el que gana tu trabajo específico, a tu presupuesto.