
Claude Sonnet 5: qué cambia, cuánto cuesta y cómo migrar tus agentes
Claude Sonnet 5 (model id claude-sonnet-5) salió el 30 de junio de 2026 como el Sonnet más agéntico hasta hoy: rinde cerca de Opus 4.8 a menor precio y ya es el predeterminado en Free y Pro. Cuesta $2/$10 por MTok de intro hasta el 31 de agosto, luego $3/$15, con contexto de 1M, salida de 128k y adaptive thinking (effort por defecto en high).
Qué acaba de salir (y por qué te importa como dev)
Hoy, 30 de junio de 2026, Anthropic lanzó Claude Sonnet 5 y ya está vivo en todas las apps de Claude y en la Claude Platform/API. No es un anuncio para leer y archivar: es el modelo que probablemente vas a poner en producción esta semana. Lo describen como “la mejor combinación de velocidad e inteligencia” y “el Sonnet más agéntico hasta hoy” — hace planes, usa herramientas (navegadores, terminales), corre de forma autónoma y, según Anthropic, revisa su propio output sin que se lo pidas. Cosas que hace unos meses exigían modelos más grandes y más caros.
Y aquí va mi lectura de ingeniero, no de boletín de prensa: la historia real para quienes construimos no es “subió en un benchmark”. Es costo × agencia. Puedes correr agentes autónomos, que usan herramientas y se autoverifican, a precio de Sonnet — no a precio de Opus. Eso cambia el cálculo rápido (de servilleta) de cualquier producto con agentes que estés armando desde Puebla o desde donde sea.
Ya es el modelo predeterminado en Free y Pro, y está disponible para Max, Team y Enterprise. En este tutorial te doy primero los datos duros que necesitas para decidir, luego el cómo migrar tus agentes en cinco pasos, y al final el marco para elegir entre Sonnet 5, Opus 4.8 y Haiku 4.5. Honesto con la brecha frente a Opus y con que el precio intro tiene fecha de caducidad.
Los datos que de verdad necesitas: id, precio, specs
Antes de tocar código, los hechos que importan para decidir.
Model id: es claude-sonnet-5. Esto es a la vez el id de la API y el alias — un formato de snapshot fijo pero sin fecha, así que no le agregues sufijo de fecha. En Bedrock es anthropic.claude-sonnet-5 y en Google Cloud claude-sonnet-5.
Precio (a la fecha de lanzamiento, confirma el precio actual): el estándar es $3 / MTok de input y $15 / MTok de output. Hay un precio introductorio de $2 / $10 hasta el 31 de agosto de 2026, y después revierte a $3/$15. A precio estándar eso es ~60% más barato por token que Opus 4.8 ($5 / $25).
Specs: ventana de contexto de 1M de tokens; salida máxima de 128k (hasta 300k en la Batch API con el beta header output-300k-2026-03-24); knowledge cutoff confiable de enero de 2026; latencia comparativa “Fast”.
Superficie de API: es la superficie moderna de adaptive thinking. Aquí hay un matiz importante frente a Opus 4.8: en Sonnet 5 el adaptive thinking ya viene activado por defecto, no necesitas configurar thinking para encenderlo (en Opus 4.8 sí tienes que setear thinking: {"type": "adaptive"} explícito). Aun así, dejarlo explícito en Sonnet 5 no hace daño y deja claro el intent; si quieres apagarlo del todo, usas thinking: {"type": "disabled"}. La profundidad la controlas con output_config.effort (low/medium/high/max), que por defecto está en high en la Claude API y en Claude Code. Si quieres otra cosa, lo pones explícito.
Fuentes oficiales: Anthropic — Introducing Claude Sonnet 5, Models overview y Pricing. Si quieres el panorama completo de cuánto cuesta meter IA en tu app, lo desgloso en el panorama de costo de la IA.
¿Qué tan agéntico es en serio? La lectura honesta de los benchmarks
No te voy a vender que Sonnet 5 es el modelo más fuerte del planeta, porque no lo es. Aquí van las cifras reportadas por Anthropic (confirma tú mismo los nombres exactos de los evals en el anuncio, porque eso importa): en una evaluación de coding agéntico, Sonnet 5 ronda 63.2%, frente a Opus 4.8 en ~69.2% y Sonnet 4.6 en ~58.1%. También lo evaluaron en BrowseComp (búsqueda agéntica) y OSWorld-Verified (uso de computadora) a distintos niveles de effort, donde —según las gráficas del anuncio— se acerca bastante a Opus a lo largo de los niveles en búsqueda.
Mi lectura, etiquetada como opinión: Sonnet 5 cierra la mayor parte de la brecha con Opus 4.8, pero a una fracción del costo. En las tareas de coding agéntico más duras, Opus 4.8 todavía manda. Dicho sin rodeos — Sonnet 5 es el punto óptimo de la gama de valor, no la frontera absoluta. Esa sigue siendo Opus 4.8 (y Fable 5).
¿Por qué esto le importa a quien construye en México? Porque puedes enviar agentes autónomos, que usan herramientas y se autoverifican, sin pagar tarifas de Opus. Para un equipo chico, esa diferencia de precio es la que decide si un producto con agentes es rentable o no. Si quieres ver cómo se comparan los modelos frontera entre sí, lo cubro en cómo se comparan los modelos frontera.
Migra tus agentes en cinco pasos
La migración desde Sonnet 4.6 es chica. Aquí está el camino concreto.
Paso 1 — cambia el model string a claude-sonnet-5. Una llamada mínima a la Messages API se ve así:
import anthropic
client = anthropic.Anthropic()
resp = client.messages.create(
model="claude-sonnet-5", # antes: claude-sonnet-4-6
max_tokens=4096,
thinking={"type": "adaptive"}, # en Sonnet 5 ya está on por defecto; explícito por claridad
output_config={"effort": "high"}, # por defecto ya es "high"; explícito por claridad
messages=[
{"role": "user", "content": "Resume este ticket y propón un fix."}
],
)
# Lee el uso real de tokens para modelar tu factura
print(resp.usage.input_tokens, resp.usage.output_tokens)
Paso 2 — usa adaptive thinking. Extended thinking / budget_tokens no está soportado en esta superficie. Si lo usabas, quítalo. En Sonnet 5 el adaptive thinking ya viene encendido por defecto, así que ni siquiera tienes que setear thinking; pero dejarlo explícito con thinking: {"type": "adaptive"} no hace daño y documenta el intent. El diff de migración es básicamente esto:
- model="claude-sonnet-4-6",
- thinking={"type": "enabled", "budget_tokens": 8000},
+ model="claude-sonnet-5",
+ thinking={"type": "adaptive"},
+ output_config={"effort": "high"},
Paso 3 — recalibra el effort. Como output_config.effort por defecto está en high en la Claude API y Claude Code, vuelve a calibrar: si venías de modelos viejos con otro comportamiento por defecto, ahora podrías estar gastando más razonamiento del que necesitas. Bájalo a medium o low para llamadas simples; sube a max solo para lo más duro.
Paso 4 — tira los sampling params que ya no se usan. temperature, top_p y top_k no se usan en esta superficie. Quítalos del request; no hacen nada.
Paso 5 — corre un piloto durante la ventana de precio intro y agrega prompt caching. Mientras el precio está en $2/$10 (hasta el 31 de agosto), corre cargas reales. Y mete cache_control para recortar el costo de input en system prompts y definiciones de tools que se repiten en cada vuelta del agente:
resp = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
thinking={"type": "adaptive"},
system=[
{
"type": "text",
"text": "Eres un agente de soporte. [system prompt largo...]",
"cache_control": {"type": "ephemeral"}, # cachea el prompt repetido
}
],
messages=[{"role": "user", "content": "¿Cómo cancelo mi suscripción?"}],
)
Confirma los breaking changes exactos en la guía de migración de Anthropic. Todo lo demás es la Messages API de siempre: tool use, structured outputs vía output_config.format y prompt caching. Te dejo más a fondo el prompt caching para bajar aún más la factura de Sonnet 5 con caché.
- Cambia el model stringa claude-sonnet-5 (sin fecha)
- Usa adaptive thinkingquita budget_tokens; en Sonnet 5 ya está on por defecto
- Recalibra el effortpor defecto es high; ajústalo por tarea
- Corre un piloto en la ventana intro$2/$10 hasta el 31 de agosto
- Agrega prompt cachingcache_control en system y tools
Sonnet 5 vs Opus 4.8 vs Haiku 4.5: ¿cuál elijo?
Aquí está el marco de decisión que uso, sin religión:
- Sonnet 5 para cargas agénticas a escala — agentes autónomos, que usan herramientas y se autoverifican, a precio de Sonnet. Es el balance óptimo de costo × agencia. Mi default.
- Opus 4.8 ($5/$25) cuando necesitas lo absolutamente top en el coding agéntico más duro o en trabajo de horizonte largo. No lo pongas en todo: úsalo donde de verdad gana.
- Haiku 4.5 ($1/$5) para las llamadas simples más baratas y rápidas. Ojo con sus límites distintos: 200k de contexto, 64k de salida, cutoff de febrero de 2025 y extended thinking (no adaptive).
Visto por precio de output por MTok: Haiku 4.5 a $5, Sonnet 5 a $10 intro / $15 estándar, Opus 4.8 a $25. A precio estándar, Sonnet 5 sale ~60% más barato que Opus.
Mi regla práctica: default a Sonnet 5, escala tareas duras puntuales a Opus, baja las triviales a Haiku. Enruta por tarea, no por costumbre. Si pones Opus en todo, estás quemando presupuesto; si pones Haiku en todo, estás dejando calidad en la mesa.
Sonnet 5
- Agencia casi-Opus a ~60% menos costo
- Default en Free y Pro
- Punto óptimo para agentes a escala
- ~63.2% en coding agéntico (cifra reportada)
Opus 4.8
- La frontera en el coding agéntico más duro
- ~69.2% en coding agéntico (cifra reportada)
- $5/$25 por MTok
- Para horizonte largo y lo absolutamente top
La jugada de costo: corre el piloto ya y cachea de forma agresiva
La ventana intro ($2/$10) corre hasta el 31 de agosto de 2026 y luego revierte a $3/$15. La jugada es clara: prueba cargas reales en piloto ahora, mientras los números por token están en su punto más barato — pero construye asumiendo precio estándar. No bases tus unit economics en un descuento con fecha de caducidad.
La mayor palanca para bajar la factura en loops de agentes es prompt caching (cache_control). Tus system prompts y definiciones de tools se repiten en cada vuelta; cachearlos recorta el costo de input de forma directa. Para jobs offline o en lote, la Batch API desbloquea hasta 300k de salida (beta header output-300k-2026-03-24) más descuentos de batch.
Modela tu factura a precio estándar para que tus números sobrevivan al 1 de septiembre. Trata el descuento intro como bono, no como cimiento. El ángulo práctico para México y LATAM: costo × agencia significa que un equipo chico puede correr agentes en producción que hace unos meses pedían presupuesto de gama Opus. Antes de mandarlo a prod, revisa cómo correr el modelo bien en correr el modelo en producción, y si quieres más guías de agentes, están en más guías de agentes de IA.
Preguntas frecuentes
¿Cuál es el model id exacto? claude-sonnet-5 — sin sufijo de fecha (es un snapshot fijo sin fecha); el mismo string sirve para el id de la API y el alias.
¿Soporta budget_tokens / extended thinking? No. Solo adaptive thinking, que además ya viene encendido por defecto; si lo quieres explícito, thinking: {"type": "adaptive"}, y para apagarlo, thinking: {"type": "disabled"}. La profundidad la controlas con effort.
¿En qué está el effort por defecto? En high, en la Claude API y en Claude Code. Ponlo explícito para cambiarlo.
¿El precio de $2/$10 es permanente? No. Es introductorio hasta el 31 de agosto de 2026, después $3/$15. Confirma el precio actual en los docs de Pricing.
¿Qué tan grande es el contexto / la salida? 1M de contexto, 128k de salida (300k en la Batch API con el beta header), cutoff de conocimiento de enero de 2026.
¿Se pueden poner temperature / top_p / top_k? No. Esos sampling params no se usan en esta superficie.
En resumen
Sonnet 5 es el punto óptimo de costo × agencia: autonomía casi de Opus a ~60% menos costo, y ya es el default en Free y Pro. La migración es chica — cambias el model string, usas adaptive thinking (que ya viene on por defecto), tiras budget_tokens y recalibras el effort. Corre un piloto durante la ventana intro, cachea de forma agresiva y modela la factura a precio estándar para no llevarte sustos en septiembre. Reserva Opus 4.8 para cuando de verdad necesitas la frontera absoluta, y manda a Haiku 4.5 las llamadas simples y baratas. Enruta por tarea, no por costumbre.