Codex (GPT-5.5) vs Claude Fable 5 para programar: ¿por cuál vale la pena pagar? — Cesar Ayala
← Todos los artículos

Codex (GPT-5.5) vs Claude Fable 5 para programar: ¿por cuál vale la pena pagar?

Ambos son excelentes. Claude Fable 5 gana en capacidad bruta (SWE-Bench Pro 80.3% vs 58.6% de GPT-5.5) para el trabajo más largo y de toda la base de código. Pero GPT-5.5 en Codex cuesta la mitad ($5/$30 vs $10/$50) y rinde ~40% más por token, así que gana en costo por tarea resuelta para la mayoría del código.

Actualización — 30 de junio de 2026: Claude Fable 5 (claude-fable-5) regresa. Tras levantarse el 30 de junio la directiva de control de exportaciones del 12 de junio que había dejado ambos modelos fuera de línea, Anthropic redespliega Fable 5 a nivel global el 1 de julio de 2026 en Claude Platform, Claude.ai, Claude Code y Claude Cowork (los proveedores de nube en cuanto puedan). Vuelve con nuevos clasificadores de seguridad que bloquean ciertas tareas dañinas de ciberseguridad; en las plataformas de Anthropic las solicitudes bloqueadas caen a Opus 4.8, y Anthropic advirtió más falsos positivos en tareas rutinarias de código y depuración que seguirá afinando. Consulta qué cambia en el redespliegue y cómo manejar el fallback del clasificador como desarrollador. El análisis de abajo describe a Fable 5 tal como se lanzó; considera su disponibilidad y precios vigentes de nuevo.

¿Qué estamos comparando en realidad?

Antes de pelear por benchmarks, aclaremos los nombres, porque aquí hay confusión real. Cuando alguien dice “Codex 5.5” no se refiere a un modelo nuevo: se refiere a GPT-5.5 corriendo dentro de Codex, la herramienta agéntica de programación de OpenAI (su CLI). Codex es el agente; GPT-5.5 es el motor. Son dos cosas, y vale la pena tenerlo claro antes de comparar.

GPT-5.5 salió el 23 de abril de 2026 y está en ChatGPT, en Codex (Plus, Pro, Business, Enterprise) y en la API. Del otro lado, Claude Fable 5 salió el 9 de junio de 2026: un nivel nuevo —clase Mythos— que Anthropic ubica por encima de Opus, es la versión protegida de Mythos, y debutó #1 en el Artificial Analysis Intelligence Index.

Ahora, mi marco como builder. La pregunta que importa no es “¿cuál saca más puntos?”. Esa es fácil y, como verás, ya tiene respuesta. La pregunta que de verdad decide tu factura es otra: ¿cuál me da el menor costo por tarea efectivamente resuelta? Un modelo puede ganar la tabla de posiciones y aun así ser la peor decisión para el 80% de tu trabajo. Todo este post gira alrededor de esa diferencia.

¿Quién gana los benchmarks y qué tan grande es la diferencia?

Empiezo por darle a Fable su crédito, porque sin eso la crítica de precio no pesa.

El número titular sale de la propia presentación de Fable 5 de Anthropic: en SWE-Bench Pro, Fable 5 marca 80.3% contra 58.6% de GPT-5.5. Son ~22 puntos de diferencia (+21.7), con Fable arriba. Y SWE-Bench Pro no es un benchmark de juguete: mide resolución de issues reales de GitHub de extremo a extremo. Ahí Fable claramente manda.

No es el único hueco verificado. Anthropic reporta razonamiento legal de 13.3% para Fable vs 2.1% de GPT-5.5, razonamiento espacial de Fable en 38.6%, visión a la vanguardia y FrontierCode a ~2x Opus 4.8.

Hay más números rondando, pero esos los trato con pinzas porque no vienen de los anuncios oficiales. Comparaciones de terceros reportan Terminal-Bench con Fable ~88% vs GPT-5.5 ~83% en una corrida del CLI de Codex (y, por separado, OpenAI reportó GPT-5.5 en ~82.7% en Terminal-Bench 2.0), y en contexto largo a 1M de tokens, GraphWalks con Fable 68.1% vs GPT-5.5 45.4%. Tómalos como señal, no como verdad firmada.

Mi lectura honesta: en capacidad bruta, Fable 5 va adelante, sobre todo en resolución de issues reales de punta a punta. Pero —y este es el punto del post— una ventaja en benchmark no es lo mismo que mejor valor. Una cosa es ganar la carrera; otra es ser lo que conviene pagar.

¿Cuánto cuesta de verdad usar cada uno?

Aquí se voltea la matemática. Precios verificados por millón de tokens:

  • GPT-5.5: $5 entrada / $30 salida (Standard). GPT-5.5 Pro: $30 / $180.
  • Claude Fable 5: $10 entrada / $50 salida — aproximadamente 2x GPT-5.5, y también ~2x Opus 4.8.
  • Opus 4.8 (referencia): $5 / $25.

Fable tiene una palanca que suaviza: con el descuento de 90% por prompt-caching, la entrada cacheada baja a ~$1/M. Real, pero no cambia el costo de salida, que es donde se va el dinero en tareas agénticas.

Y ahora el dato que casi nadie pone en la balanza: GPT-5.5 usa ~40% menos tokens de salida que GPT-5.4 en las mismas tareas de Codex, y mantiene la misma latencia por token. Es decir, no solo cuesta la mitad por token: además gasta menos tokens para hacer el mismo trabajo. Esos dos efectos se multiplican.

Precio por millón de tokens: GPT-5.5 vs Fable 5 vs Opus 4.8

Fable 5 — salida$50/M
GPT-5.5 — salida$30/M
Opus 4.8 — salida$25/M
Fable 5 — entrada$10/M
GPT-5.5 — entrada$5/M
Opus 4.8 — entrada$5/M
Fable 5 cuesta ~2x GPT-5.5 tanto en entrada como en salida. Opus 4.8 es la referencia barata. Números verificados de los anuncios oficiales.

Una nota de contexto que importa para programar: ambos ofrecen ventana de 1,000,000 de tokens, pero Codex limita a GPT-5.5 a 400,000 tokens dentro de la herramienta, mientras que Fable 5 acepta hasta 1M de tokens de entrada (texto, imagen y archivo). Para la mayoría del trabajo, 400K alcanza de sobra; para una base de código entera de una sola pasada, esa diferencia cuenta.

El efecto combinado: mitad de precio por token y menos tokens de salida significa que, a volumen, GPT-5.5 suele ser la opción de menor costo por tarea exitosa.

Costo por tarea resuelta: dónde el doble de precio sí se justifica

Aquí está la tensión, y la quiero poner sin trampa: Fable lleva 22 puntos de ventaja en SWE-Bench Pro, pero GPT-5.5 cuesta la mitad y usa ~40% menos tokens de salida en las mismas tareas de Codex. ¿Cuál gana?

Mi lectura: para trabajo de alto volumen y de estilo terminal, GPT-5.5 normalmente gana en costo por tarea resuelta —más barato por token y usando menos tokens. Si el modelo barato ya resuelve la tarea, pagar el doble por una que también la resolvería es quemar presupuesto. La matemática fina de esto la desglosé en cuánto cuesta integrar IA en tu app.

¿Entonces cuándo se gana Fable su 2x? En la cola dura: las tareas que GPT-5.5 no termina y Fable sí. Autonomía de largo horizonte y resolución a nivel de toda la base de código. Ahí la capacidad no es un lujo en la tabla de posiciones: es la diferencia entre una tarea que se entrega y una que se queda a medias.

La prueba verificada de esa forma de trabajo no es un benchmark, es un cliente: Anthropic reporta que Stripe usó Fable 5 para migrar un codebase de Ruby de 50 millones de líneas en un solo día. Quien ha vivido una migración grande sabe que eso no es “un poco mejor”: es otra categoría.

Replanteo, y es la idea central del post: no pagues 2x por un modelo en tareas que el modelo más barato ya resuelve. Paga 2x solo donde la capacidad se convierte en una tarea que de otro modo no saldría.

¿A cuál le pagas, y por qué?

Paga GPT-5.5 cuando…

  • Programación de alto volumen y estilo terminal
  • Cargas sensibles al costo
  • La eficiencia por token importa (~40% menos salida)
  • Análisis a fondo crítico en exactitud → GPT-5.5 Pro

Paga Claude Fable 5 cuando…

  • Autonomía de largo horizonte, la más dura
  • Resolución a nivel de toda la base de código
  • La forma de la migración de 50M de líneas de Stripe
  • Trabajo multi-etapa, pesado en documentos
No es lealtad de marca: es forma de la tarea. Cada columna gana en su terreno.

La trampa de facturación del fallback de Fable que debes conocer

Si vas a meter Fable en producción, hay dos cosas verificadas que tienes que saber antes de firmar. No son motivos para descartarlo, pero sí letra que conviene leer.

Uno: el fallback de seguridad. Fable 5 enruta automáticamente las consultas de ciberseguridad, biología y destilación de modelos a Claude Opus 4.8, y te avisa. El matiz de facturación es el que pica: en esos temas marcados recibes el desempeño de Opus 4.8 y te cobran a tarifa de Opus 4.8 ($5/$25), no a tarifa de Fable. Es justo en el cobro, pero significa que tu “modelo Fable” no siempre es Fable. La buena noticia: más del 95% de las sesiones nunca hacen fallback, así que es un caso de borde, no la norma —relevante solo si tu trabajo toca esos dominios.

Dos: la retención de datos. Aplica una retención obligatoria de 30 días a todo el tráfico de Fable/Mythos, incluso a clientes con contrato de cero retención. Esta, en mi opinión, pesa más que el fallback para equipos regulados. El fallback es un caso de borde; la retención aplica a todo tu tráfico. Si manejas datos de cliente o regulados, mételo en la decisión del modelo por defecto, no en una nota al pie. Mi opinión completa sobre el precio y la retención de Fable la dejé en si vale la pena Claude Fable 5.

El insight de costo por tarea + la trampa del fallback

GPT-5.5 — la economíaMitad de precio ($5/$30 vs $10/$50) y ~40% menos tokens de salida en las mismas tareas de Codex
Fable 5 — la capacidadLidera SWE-Bench Pro 80.3% vs 58.6% (+21.7 pts) en issues reales de extremo a extremo
Fallback de FableCyber/bio/destilación se enrutan a Opus 4.8 y se cobran a $5/$25 — pagas tarifa de Opus, no de Fable
Retención30 días obligatorios para TODO el tráfico Fable/Mythos, incluso con cero retención
Lo que sopeso antes de enrutar tráfico de producción. Capacidad de Fable contra economía de GPT-5.5, más la letra chica del cobro.

Entonces, ¿a cuál le cargo cada tarea?

La parte práctica, la que de verdad uso. Enruta por forma de tarea, no por ranking de la tabla de posiciones.

Por defecto: GPT-5.5 (u Opus 4.8) para programación diaria, centrada en terminal. Es eficiente en costo y en tokens. Aquí cae la mayoría de tu trabajo, y aquí el modelo barato ya resuelve.

Cola dura: Claude Fable 5 para el trabajo más largo y de toda la base de código, donde el sobreprecio se convierte en una tarea resuelta —la forma de la migración de Stripe. Si tu tarea no tiene ese horizonte, no necesitas Fable.

Crítico en exactitud: GPT-5.5 Pro para análisis a fondo donde estar en lo correcto vale el precio.

Antes de asumir que necesitas el modelo más potente, conviene preguntarte si necesitas siquiera un agente: muchas veces una automatización simple basta, como argumenté en agentes de IA vs automatización.

¿A qué modelo le cargo esta tarea?

  1. ¿Es programación diaria, centrada en terminal?Sí → GPT-5.5 en Codex (u Opus 4.8). Eficiente en costo y en tokens. Aquí cae el grueso del trabajo.
  2. ¿Es el trabajo más largo o de toda la base de código?Sí → Claude Fable 5. La forma de la migración de 50M de líneas de Stripe; aquí el 2x se gana su lugar.
  3. ¿Es un análisis a fondo crítico en exactitud?Sí → GPT-5.5 Pro. Cuando estar en lo correcto vale el precio del Pro.
Tres preguntas en orden. La primera filtra la gran mayoría del trabajo hacia el modelo barato.

Mi elección decisiva, sin rodeos: GPT-5.5 en Codex como mi daily driver, y Fable 5 con correa para los trabajos que de verdad lo necesitan. Yo enruto; no elijo un solo ganador. Esa es la respuesta honesta.

Preguntas frecuentes

¿“Codex 5.5” es un modelo aparte? No. Es GPT-5.5 corriendo dentro de Codex, el agente de programación de OpenAI. El motor es GPT-5.5; Codex es la herramienta.

¿Fable 5 vale el doble de precio? Solo para los trabajos más duros de largo horizonte o de toda la base de código. Para programación diaria, GPT-5.5 suele ganar en costo por tarea —opinión mía, anclada en el precio verificado ($10/$50 vs $5/$30) y en SWE-Bench Pro (80.3% vs 58.6%).

¿Cuál tiene la ventana de contexto más grande para programar? Ambos ofrecen 1M de tokens, pero Codex limita a GPT-5.5 a 400K dentro de la herramienta; Fable 5 acepta hasta 1M de tokens de entrada (texto, imagen y archivo).

¿Fable 5 alguna vez degrada en silencio? No en silencio: enruta consultas de cyber/bio/destilación a Opus 4.8 y te avisa. Más del 95% de las sesiones nunca hacen fallback.

¿Y la retención de datos? El tráfico de Fable/Mythos tiene una retención obligatoria de 30 días, incluso bajo acuerdos de cero retención.

En resumen

Fable 5 es el modelo más capaz; GPT-5.5 en Codex es, casi siempre, el mejor valor. Las dos cosas son ciertas a la vez, y reconocerlo es todo el chiste.

Paga por capacidad solo donde se convierte en tareas que de otro modo no saldrían. Para el resto —que es la mayoría de tu trabajo— el modelo barato y eficiente en tokens te lleva más lejos por peso. Ambos son genuinamente buenos: el truco no es lealtad, es enrutar.

Verifica los números tú mismo en los anuncios oficiales: OpenAI sobre GPT-5.5 y Anthropic sobre Claude Fable 5. Y si quieres más guías para aterrizar esto en producción, están en agentes de IA.