
Codex (GPT-5.5) vs Claude Fable 5: la comparativa honesta de un builder
Claude Fable 5 lidera en el código más difícil de toda la base y de largo plazo (SWE-Bench Pro 80.3% vs 58.6%), pero cuesta casi el doble ($10/$50 vs $5/$30). GPT-5.5 en Codex es el default eficiente. Enruta por tarea: Fable para lo difícil, GPT-5.5 para el resto.
Actualización — 30 de junio de 2026: Claude Fable 5 (
claude-fable-5) regresa. Tras levantarse el 30 de junio la directiva de control de exportaciones del 12 de junio que había dejado ambos modelos fuera de línea, Anthropic redespliega Fable 5 a nivel global el 1 de julio de 2026 en Claude Platform, Claude.ai, Claude Code y Claude Cowork (los proveedores de nube en cuanto puedan). Vuelve con nuevos clasificadores de seguridad que bloquean ciertas tareas dañinas de ciberseguridad; en las plataformas de Anthropic las solicitudes bloqueadas caen a Opus 4.8, y Anthropic advirtió más falsos positivos en tareas rutinarias de código y depuración que seguirá afinando. Consulta qué cambia en el redespliegue y cómo manejar el fallback del clasificador como desarrollador. El análisis de abajo describe a Fable 5 tal como se lanzó; considera su disponibilidad y precios vigentes de nuevo.
Espera, ¿qué es exactamente “Codex 5.5”?
Antes de comparar nada, hay que limpiar la confusión de nombres, porque circula mucho “Codex 5.5” como si fuera un modelo nuevo y no lo es. “Codex 5.5” es GPT-5.5 corriendo dentro de Codex, la herramienta agéntica de codificación de OpenAI (su CLI/agente de terminal). El modelo es GPT-5.5; Codex es el agente donde lo usas. Dicho de frente para que nadie se pierda.
GPT-5.5 salió el 23 de abril de 2026, disponible en ChatGPT y en Codex (Plus, Pro, Business, Enterprise) y en la API. Por el otro lado, Claude Fable 5 salió el 9 de junio de 2026: un nivel nuevo —clase Mythos— que Anthropic ubica por encima de Opus, es la versión con salvaguardas de Mythos, y debutó #1 en el Artificial Analysis Intelligence Index. Si quieres el contexto completo del lanzamiento, lo desglosé en qué es Claude Fable 5.
Esto es una comparativa honesta de builder, no un panfleto a favor de ninguno. Cada uno gana en cosas reales, y lo voy a nombrar tal cual.
Los benchmarks: ¿quién programa mejor de verdad?
El número que manda, y que sale de la propia presentación de Fable 5 de Anthropic: en SWE-Bench Pro, Fable 5 marca 80.3% contra 58.6% de GPT-5.5. Son ~22 puntos de diferencia a favor de Fable. Y no es cualquier benchmark: SWE-Bench Pro mide resolución de issues reales de GitHub de punta a punta, sobre toda la base de código. Ahí, hoy, Fable lleva la delantera.
Otros datos verificados del mismo anuncio de Anthropic: razonamiento legal Fable 13.3% vs GPT-5.5 2.1%, razonamiento espacial de Fable 38.6%, visión state-of-the-art, y FrontierCode ~2x Opus 4.8.
SWE-Bench Pro: resolución de código de punta a punta
Ahora, justicia para GPT-5.5, porque la merece: es de lo más fuerte que hay en codificación agéntica centrada en terminal, dentro de Codex. Comparativas de terceros reportan Terminal-Bench alrededor de Fable ~88% vs GPT-5.5 ~83%, y OpenAI reportó por separado a GPT-5.5 en ~82.7% en Terminal-Bench 2.0. Lo dejo atribuido y blando a propósito.
Hay más cifras que rondan —comparativas de terceros reportan FrontierCode Diamond 29.3% vs 5.7%, OSWorld-Verified 85.0% vs 78.7%, GraphWalks a 1M de contexto 68.1% vs 45.4%, y GPT-5.5 en ARC-AGI-2 al 85.0%—, pero esas no salen de los anuncios oficiales y se mueven mes con mes.
Opinión, etiquetada como tal: la lectura segura y durable es SWE-Bench Pro más el precio. Las cifras exactas de terceros cambian y no deberían anclar tu decisión. Si vas a decidir con un solo número, que sea el de 80.3% vs 58.6%.
¿Cuánto cuesta cada uno?
Aquí es donde un desarrollador de verdad decide. Los precios verificados, por millón de tokens:
- Claude Fable 5: $10 entrada / $50 salida. Aproximadamente 2x GPT-5.5 y ~2x Opus 4.8.
- GPT-5.5: $5 entrada / $30 salida (Standard). GPT-5.5 Pro: $30 entrada / $180 salida.
- Referencia de en medio: Claude Opus 4.8 a $5 entrada / $25 salida.
Fable trae una palanca que suaviza el golpe: el descuento de 90% por prompt-caching deja la entrada cacheada cerca de ~$1/M, lo cual pesa mucho en loops de agente que repiten contexto.
Precio de salida por millón de tokens
Pero el precio por token no es el precio por tarea, y ahí está el matiz que importa. Como GPT-5.5 cobra ~la mitad por token que Fable y usa ~40% menos tokens de salida en las mismas tareas de Codex, termina siendo, a volumen, la opción más barata por tarea resuelta. Si quieres la matemática fina de los tokens, la desglosé en cuánto cuesta integrar IA en tu app.
Ventanas de contexto y eficiencia de tokens
Los dos llegan a ~1,000,000 de tokens: Fable 5 (texto, imagen y archivo de entrada) y GPT-5.5 vía API. En contexto crudo, empatan.
Hay una letra chica que sí importa: GPT-5.5 está topado a 400,000 tokens dentro de Codex específicamente. El millón completo solo lo consigues por la API. Si tu flujo vive en el CLI de Codex y necesitas más de 400K de contexto, eso es una restricción real.
El otro punto verificado es la eficiencia: GPT-5.5 usa ~40% menos tokens de salida que GPT-5.4 en las mismas tareas de Codex, manteniendo la misma latencia por token. Es notablemente eficiente en tokens.
Lectura práctica: esa eficiencia se compone con el precio más bajo, y por eso GPT-5.5 se gana su lugar como default para el trabajo agéntico de todos los días. No es que sea “el mejor”; es que es el más barato de operar cuando la tarea no es la difícil de verdad.
Dónde gana cada uno de verdad
Sin tibieza, porque cada uno tiene su terreno.
Claude Fable 5 lidera en resolución sobre toda la base de código (esa es la brecha de SWE-Bench Pro), en autonomía de largo horizonte, y en trabajo multietapa o pesado en documentos. El ejemplo concreto y verificado: Anthropic reporta que Stripe usó Fable 5 para migrar una base de código de Ruby de 50 millones de líneas en un solo día. Eso es entrega agéntica sostenida, no un sprint de cinco minutos.
GPT-5.5 / Codex gana en codificación agéntica centrada en terminal, en eficiencia de costo y en eficiencia de tokens. Es un default fuerte y barato de operar.
Dónde gana cada uno
Claude Fable 5
- Resolución sobre toda la base de código (SWE-Bench Pro 80.3% vs 58.6%)
- Autonomía de largo horizonte
- Trabajo multietapa y pesado en documentos
- Stripe: migración de Ruby de 50M de líneas en un día
GPT-5.5 / Codex
- Codificación agéntica centrada en terminal
- Eficiente en costo (~mitad del precio por token)
- Eficiente en tokens (~40% menos salida)
- Default fuerte y barato de operar
Opinión, etiquetada: la mayoría del trabajo diario no es la cola difícil. Saca a Fable cuando la tarea sea genuinamente de largo horizonte o cruce toda la base de código, no por reflejo. Y ojo: como ambos traen ~1M de contexto, el tamaño de contexto solo no es el factor que decide. La forma de la tarea sí lo es.
La letra chica de Fable: las advertencias que todo builder debe saber
Dos cosas verificadas de Fable que pertenecen a cualquier comparación honesta.
Uno: un fallback de seguridad (un reenvío automático a otro modelo). Fable 5 enruta automáticamente las consultas de ciberseguridad, biología y destilación de modelos a Claude Opus 4.8, y te avisa. En esos temas pagas precio Fable pero efectivamente recibes Opus 4.8 —y se te cobra a tarifa de Opus 4.8 ($5/$25) ahí. La buena noticia, también verificada: más del 95% de las sesiones nunca se reenrutan, así que para la mayoría de los builders esto es un caso borde, no un impuesto diario.
Dos: retención de datos obligatoria de 30 días. Aplica a todo el tráfico de Fable/Mythos, incluso a clientes con contratos de cero retención. Para cargas reguladas o sensibles, eso es parte de la decisión, no una nota al pie.
Nota de justicia: estos son tradeoffs reales, no dealbreakers para la mayoría. Pero si vas a comparar de verdad, van en la mesa. Cómo poner topes de costo y routing en producción lo aterricé en llevar un LLM a producción.
FAQ: respuestas rápidas que preguntan los builders
¿Fable 5 vale el doble de precio? Solo para la cola difícil de largo horizonte o sobre toda la base de código, donde la brecha de SWE-Bench Pro se paga sola. Para lo demás, GPT-5.5 o incluso Opus 4.8 es la opción eficiente.
¿Cuál sale más barato por tarea? Normalmente GPT-5.5: ~la mitad del precio por token y ~40% menos tokens de salida.
¿Los dos tienen 1M de contexto? Sí. Pero GPT-5.5 está limitado a 400K dentro de Codex; el millón completo solo por API.
¿Fable alguna vez le pasa la consulta a otro modelo? Sí. Las consultas de ciberseguridad, biología y destilación se enrutan automáticamente a Opus 4.8 (cobradas a tarifa de Opus). Más del 95% de las sesiones nunca lo tocan.
¿Y la retención de datos con Fable? Una retención obligatoria de 30 días aplica a todo el tráfico Fable/Mythos, incluso bajo contratos de cero retención.
El veredicto: enruta por tarea, no por hype
Sin rodeos, así enruto yo:
- Default a GPT-5.5 (o a Opus 4.8) para el trabajo agéntico y de terminal de todos los días, donde la eficiencia de costo manda.
- Saca a Claude Fable 5 para los trabajos más difíciles de largo horizonte o sobre toda la base de código, donde el sobreprecio de 2x claramente se paga.
- Usa GPT-5.5 Pro para inmersiones profundas críticas en exactitud.
Enruta por forma de tarea
Conclusión, etiquetada como opinión: no hay un único ganador, y quien te diga lo contrario te está vendiendo algo. El gane real es disciplina de routing: saber qué forma de tarea va a qué modelo, y no pagar precio de frontera por trabajo que un modelo a mitad de costo te resuelve igual. Más guías para aterrizar esto en producción, en agentes de IA.