Claude Opus 5, explicado: qué lanzó Anthropic y por qué cuesta la mitad que Fable 5 — Cesar Ayala
← Todos los artículos

Claude Opus 5, explicado: qué lanzó Anthropic y por qué cuesta la mitad que Fable 5

El 24 de julio de 2026, Anthropic lanzó Claude Opus 5 (ID claude-opus-5) a $5/$25 por millón de tokens de entrada/salida — la mitad del precio de Fable 5. Iguala buena parte de la capacidad de Fable 5 (CursorBench a 0.5%, OSWorld por encima), más que duplica a Opus 4.8 en Frontier-Bench (43.3%) y es el nuevo modelo por defecto en Claude Code.

Lanzado el 24 de julio de 2026: Claude Opus 5 (claude-opus-5) está disponible en Claude.ai, Claude Code, Claude Cowork y la Claude API, además de AWS, Google Cloud Vertex AI y Microsoft Foundry. Es el nuevo modelo por defecto en Claude Code e incluido en los planes de pago (default en Claude Max, el modelo más potente en Claude Pro). La promesa de Anthropic en una línea: buena parte de la capacidad de Fable 5 a la mitad del precio. Abajo va mi lectura de builder de lo que eso significa de verdad.

¿Qué lanzó Anthropic en realidad el 24 de julio?

El 24 de julio de 2026 Anthropic lanzó Claude Opus 5 — model ID claude-opus-5. Si construyes sobre Claude en producción como yo, ese es el string que vas a poner en tu config por un buen rato, y es el modelo que Claude Code ya usa por defecto.

Lo que más importa es el movimiento de precio contra capacidad. Opus 5 llega a $5 por millón de tokens de entrada y $25 por millón de salida — el mismo precio de lista que ha tenido el nivel Opus — y, en palabras de Anthropic, “iguala muchas de las capacidades de Fable 5”. Fable 5 cuesta $10/$50. Así que el titular no es “un poco mejor que Opus 4.8”. El titular es: calidad cercana a Fable 5 por la mitad de su precio. Eso reabre muchas decisiones de selección de modelo que yo ya había cerrado este año.

Voy a repasar los benchmarks, los dos cambios de comportamiento que de verdad cambian cómo programa, el nuevo control /effort y las advertencias — y luego te doy mi veredicto honesto.

El titular: capacidad de Fable 5 por la mitad del precio

Dos pruebas hacen concreta la frase “la mitad del precio”, en vez de marketing:

  • En CursorBench 3.2, Opus 5 “queda dentro del 0.5% del mejor puntaje de Fable 5, pero a la mitad del costo”.
  • En OSWorld 2.0 (uso de computadora / tareas de agente en escritorio), “supera el mejor resultado de Fable 5 a poco más de un tercio del costo”.

Léelo otra vez. En benchmarks reales de código agéntico y uso de computadora, Opus 5 esencialmente iguala — y en un caso supera — al modelo que hasta ahora era el techo de Anthropic, costando entre la mitad y un tercio. Para quien vio los $10/$50 de Fable 5 y en silencio decidió que el nivel más alto no valía la pena para el día a día, esa cuenta acaba de cambiar.

Claude Opus 5 de un vistazo

Lanzamiento24 de julio de 2026 (claude-opus-5)
Precio$5 / $25 por M tokens (entrada / salida)
Fast mode~2x el precio base ($10 / $50)
vs Fable 5Buena parte de la capacidad a mitad de precio
En Claude CodeNuevo modelo por defecto
Los datos clave, directo del anuncio de Anthropic.

¿Qué tan bueno es de verdad? Los benchmarks

Estos son los números que mueven mis decisiones, no el scorecard completo.

En Frontier-Bench v0.1, Opus 5 llega a 43.3% — desde 18.7% en Opus 4.8. Anthropic lo describe como superar a todos los demás modelos y “más que duplicar” al Opus anterior. En DeepSWE v1.1 alcanza 68.8%, desde 59.0% en Opus 4.8. Esos son los dos números de código agéntico que vigilo, porque miden trabajo largo y sucio de varios pasos, no acertijos limpios de un solo tiro.

Opus 5 vs Opus 4.8: benchmarks agénticos

Frontier-Bench v0.1 — Opus 543.3%
Frontier-Bench v0.1 — Opus 4.818.7%
DeepSWE v1.1 — Opus 568.8%
DeepSWE v1.1 — Opus 4.859.0%
Verificado del anuncio de Opus 5 de Anthropic y del correo de lanzamiento. Más alto es mejor.

Más allá del código, algunos resultados me llamaron la atención:

  • ARC-AGI 3: el puntaje es “tres veces más alto que el del siguiente mejor modelo” — un salto real en el benchmark de abstracción y razonamiento donde los modelos históricamente sufren.
  • Zapier AutomationBench: tasa de éxito “alrededor de 1.5× la del siguiente mejor modelo” — la señal práctica de “sabe armar automatizaciones reales”.
  • GDPval-AA: estado del arte en este conjunto de tareas con base económica.
  • Ciencias de la vida: 10.2 puntos por encima de Opus 4.8 en química orgánica, 7.7 puntos más en predicción de proteínas.

Mi advertencia de siempre: son los números que reporta Anthropic sobre los benchmarks que Anthropic eligió. Son fuertes en dirección y consistentes con la historia de precio, pero el benchmark que importa es tu carga de trabajo. Yo aún correría Opus 5 contra tu propio set de evals antes de cambiar un default de producción — que es justo lo que haría en un proyecto de cliente, y por eso mantengo un harness de evals en el ciclo.

Qué cambió por dentro: juicio y auto-revisión

Los deltas de benchmark están bien. Los dos cambios de comportamiento son lo que creo que vas a sentir día a día.

Ejerce juicio antes de actuar. Anthropic dice que Opus 5 “con más frecuencia hace preguntas aclaratorias antes de adivinar, cuestiona instrucciones defectuosas y considera las implicaciones de su trabajo antes de saltar a la implementación”. En la práctica eso significa menos tangentes seguras-pero-equivocadas. Cuando le doy a un modelo anterior un ticket ambiguo, elige una interpretación y corre — y a veces son 20 minutos apuntando al blanco equivocado. Un modelo que se detiene a preguntar “¿te refieres a A o B?” o que dice “esta instrucción rompe X, ¿seguro?” produce código más limpio porque no está adivinando.

Revisa su propio trabajo sobre la marcha. Opus 5 “revisa su propio trabajo mientras avanza y detecta problemas que los modelos anteriores pasaban por alto”. Esa es la diferencia entre un agente que escribe un cambio y canta victoria, y uno que relee lo que escribió, nota el caso borde que rompió y lo arregla antes de devolverte. En corridas autónomas largas, la auto-revisión es lo que evita que un error pequeño temprano se acumule a lo largo de una hora de trabajo.

Qué cambió de verdad vs Opus 4.8

Mejor juicio

  • Hace preguntas aclaratorias antes de adivinar
  • Cuestiona instrucciones defectuosas
  • Sopesa implicaciones antes de implementar
  • Resultado: menos tangentes seguras-pero-equivocadas

Auto-corrección

  • Revisa su propio trabajo sobre la marcha
  • Detecta problemas que otros modelos omitían
  • Se recupera de errores a mitad de tarea
  • Rodea bloqueos en vez de detenerse
Los cambios de comportamiento importan más en el día a día que cualquier benchmark suelto.

Trabajo largo: horas, no minutos

Esta es la capacidad que más me importa. Anthropic dice que Opus 5 “puede trabajar durante horas en una tarea, recuperándose de errores y rodeando bloqueos en vez de detenerse”.

“En vez de detenerse” es la frase clave. El modo de falla de los agentes anteriores no solía ser una respuesta equivocada — era rendirse: chocar con un test que falla, una dependencia faltante, una forma de API inesperada, y frenar encogiéndose de hombros. Un modelo que rodea el bloqueo (probar otro enfoque, mockear la dependencia, leer el error y ajustar) es el que de verdad puedes dejar corriendo en una migración o refactor real.

Combínalo con la auto-revisión de arriba y obtienes una forma distinta de sistema. Dejas de construir andamiaje elaborado para picar cada trabajo en pasitos supervisados, y empiezas a entregar tareas más grandes completas. Es el mismo cambio de arquitectura que describí cuando llegó Fable 5 — Opus 5 baja buena parte de eso al nivel de $5/$25.

Ajustar el esfuerzo con /effort

Control nuevo que conviene conocer: en Claude Code ajustas el nivel de esfuerzo de Opus 5 con /effort. Te deja intercambiar inteligencia por velocidad y gasto de tokens según la necesidad.

Los niveles llegan hasta Extra y Max, que “empujan más fuerte en problemas difíciles y usan más de tu límite de uso”. La guía de Anthropic: usa High o menos para trabajo rutinario — es más rápido y ligero con tu uso. Así que el modelo mental es un dial, no un ajuste siempre-encendido.

Cómo pensar /effort

  1. High o menos — trabajo rutinarioEdiciones diarias, refactors, código de pegamento. Más rápido y ligero con tu límite de uso. Esta es la postura por defecto.
  2. Extra — problemas de verdad difícilesBugs peludos, diseño complicado, cambios largos multi-archivo donde equivocarse sale caro.
  3. Max — empujar al máximoLa cola difícil. Usa más de tu límite de uso — recurre a él cuando la corrección claramente gana al costo.
Ajusta el dial a la tarea — no quemes Max en ediciones rutinarias.

En la práctica: déjalo en High para el grueso del día y recurre a Extra/Max en la cola difícil. Gastar Max en boilerplate es solo quemar tu límite de uso sin ganancia — el punto del dial es gastar más solo donde rinde. Si eres nuevo con la herramienta, mi guía para empezar con Claude Code cubre lo básico primero.

Cuánto cuesta y dónde corre

Opus 5 cuesta $5 / $25 por millón de tokens (entrada / salida) en la API. Hay un Fast mode — salida más rápida con la misma inteligencia Opus, sin bajar a un modelo más chico — a aproximadamente el doble del base ($10/$50). En planes de suscripción está incluido: el nuevo default en Claude Max, y el modelo más potente disponible en Claude Pro. Corre en la Claude API, Claude.ai, Claude Code, Claude Cowork, además de AWS, Google Cloud Vertex AI y Microsoft Foundry.

Para cómo el precio por token se convierte en una factura mensual — y cómo el prompt caching cambia el panorama — lo desglosé en cuánto cuesta integrar IA en tu app y bajar costos de tokens con prompt caching.

La victoria silenciosa: sin retención de datos obligatoria

Un detalle que no salió en el titular pero importa si cargas obligaciones de cumplimiento. Cuando lanzó Fable 5, venía con una política de retención de datos de 30 días obligatoria que aplicaba incluso a clientes con acuerdos de cero retención — un punto conflictivo que señalé en su momento.

Opus 5 llega sin requisito de retención de datos para acceso general. Si una cláusula de retención era la razón por la que no podías enrutar tráfico de producción por el nivel más alto, ese bloqueo específico aquí desaparece. Para cargas reguladas, eso puede pesar más que un par de puntos de benchmark.

Seguridad: dónde Opus 5 aún queda por debajo de Mythos 5

Anthropic es claro en que Opus 5 “queda por detrás de Mythos 5 en tareas de ciberseguridad” y “sustancialmente por detrás” en desarrollo de exploits — a propósito. Al mismo tiempo, sus clasificadores de ciber son “proporcionalmente menos restrictivos que los de Fable 5”. El anuncio de Opus 5 no describe el reenrutamiento automático estilo Fable a un modelo de nivel inferior en temas marcados, así que para código diario y depuración cercana a seguridad esperaría menos sorpresas que con Fable 5 — pero tómalo como mi lectura, y prueba tu propio dominio si vives en herramientas de seguridad.

FAQ: respuestas rápidas para builders

¿Cuál es el model ID? claude-opus-5.

¿Cuánto cuesta? $5 / $25 por millón de tokens de entrada / salida. Fast mode es unas 2x eso.

¿De verdad es tan bueno como Fable 5? En muchas tareas, cerca. CursorBench 3.2 queda dentro del 0.5% del pico de Fable 5 a la mitad del costo; OSWorld 2.0 supera el mejor de Fable 5 a un tercio del costo. En las tareas de frontera más duras, Fable 5 / Mythos 5 aún puede liderar — ver mi comparativa Opus 5 vs Fable 5.

¿Es el default en Claude Code? Sí — Opus 5 es el nuevo modelo por defecto ahí.

¿Cómo controlo costo vs calidad? Usa /effort. High o menos para trabajo rutinario; Extra y Max para problemas difíciles (usan más de tu límite de uso).

¿Fuerza retención de 30 días como Fable 5? No — el acceso general no tiene requisito de retención de datos.

Mi veredicto

Lo interesante de Opus 5 no es un benchmark suelto — es que la línea de precio se movió. Capacidad cercana a Fable 5 (CursorBench a 0.5%, OSWorld por encima), Frontier-Bench más que duplicado sobre Opus 4.8, juicio y auto-revisión genuinos, autonomía de horas que rodea bloqueos — todo a la mitad del precio de Fable 5, sin retención obligatoria. Esa combinación lo convierte en mi nuevo default para casi todo el trabajo agéntico, y Anthropic claramente coincide, porque ya es el default en Claude Code.

Dónde aún lo pensaría dos veces: la cola de frontera más dura, y el trabajo cercano a seguridad/biología donde Mythos 5 va adelante a propósito. Para todo lo demás, el veredicto honesto es que el impuesto por calidad de nivel superior se acaba de reducir a la mitad. Si estás evaluando mover un producto de producción a Opus 5 — o cómo cablear /effort para no pagar de más — ese es el tipo de trabajo que hago.