Guías
Construir IA que aguanta producción
La mayoría de los demos de IA funcionan una vez y se rompen en producción. Estas son mis guías de ingeniería para lanzar IA de verdad — agentes, RAG, chatbots fundamentados, MCP, y el costo, la latencia y los guardarraíles que se necesitan para operar un LLM en serio.
Construir una demo de IA toma una tarde; ponerla en producción es otro trabajo. Un modelo es un predictor de texto fluido que a veces inventa, así que la parte difícil no es el prompt: es la ingeniería alrededor. Estas guías separan lo real de lo exagerado — cuándo necesitas un agente y cuándo basta un workflow, cómo darle al modelo tus datos sin que alucine, y qué se rompe cuando llegan usuarios de verdad.
El hilo que une todo es tratar la llamada al LLM como una dependencia de red poco confiable que de vez en cuando miente: la fundamentas con tus datos usando recuperación, la rodeas de guardarraíles que viven fuera del prompt, le pones topes de costo y latencia, y proteges cada cambio con evals y observabilidad. Desde "¿qué es un agente?" hasta llevar un LLM a producción, ese es el camino que recorren estas guías.
Las guías

¿Qué es un agente de IA? Guía clara para fundadores
Definición clara y sin jerga de un agente de IA: agente vs chatbot vs llamada a LLM vs workflow, cómo funcionan el loop, las herramientas y la memoria, casos con ROI real, y cuándo de verdad necesitas uno.
Leer →
Claude Code: guía para instalarlo, iniciar sesión y completar tu primera tarea
Aprende qué es Claude Code y dónde corre, instálalo con un comando, inicia sesión y completa tu primera tarea real. Guía práctica para empezar, con comandos listos para copiar y pegar.
Leer →
Claude Code vs Cursor AI (2026): Agente en Terminal vs IDE con IA — Comparación Honesta
Comparación honesta y con fuentes de Claude Code y Cursor AI: qué es cada uno, qué modelos usan, el precio real, para qué flujo sirve cada uno, extensibilidad y una regla de decisión. Sin ganador universal — incluso puedes correr Claude Code dentro de Cursor.
Leer →
Claude Code avanzado: subagentes, hooks y slash commands (guía power-user 2026)
Ya instalado Claude Code, cuatro funciones lo convierten de asistente en compañero configurado: CLAUDE.md y memoria automática, subagentes con su propia ventana de contexto, hooks de ciclo de vida y skills/slash commands. Guía de ingeniero con ejemplos reales de .claude/agents/ y settings.json, más permisos, modo plan y MCP. Verificado contra code.claude.com.
Leer →
Claude Code en CI: headless con claude -p, --bare y GitHub Actions
Corre Claude Code sin interactividad en scripts y CI: agrega -p a cualquier comando y lee stdin e imprime un resultado. Auto-aprueba herramientas con --allowedTools y su sintaxis de reglas de permiso, obtén JSON con total_cost_usd y structured_output, blinda las corridas con --bare, y conecta la revisión de PRs a GitHub Actions y GitLab CI.
Leer →
Cómo Construir un Agente de IA con Python: Guía Práctica 2026
Construye un agente de IA en Python en ~40 líneas y hazlo listo para producción. La guía honesta 2026: el loop, frameworks, costos reales y cuándo no hacerlo.
Leer →
API de Claude: tu primera llamada en cURL, Python y TS
Guia completa para empezar con la API de Claude: consigue tu key, haz tu primera llamada en cURL, Python y TypeScript, elige modelo, streaming, tools y controla costos.
Leer →
Crea un agente autónomo con Claude Sonnet 5: tool use, el loop agéntico y autoverificación
Tutorial práctico de ingeniero: arma un agente autónomo con herramientas en la Messages API con claude-sonnet-5 — tools, el loop agéntico, autoverificación, barato.
Leer →
Lleva tu integración de Claude Sonnet 5 a producción: streaming, stop reasons, reintentos y errores
La llamada feliz a Claude Sonnet 5 se rompe en producción. Endurécela con streaming, cada stop_reason, reintentos tipados, idempotencia y colas — Python real.
Leer →
Ajusta Claude Sonnet 5 para costo y calidad: effort, caché de prompts y la Batch API
Un playbook en español para sacar más calidad por peso de Claude Sonnet 5: el parámetro effort, la caché de prompts, la Batch API y el ruteo, con Python real.
Leer →
Rechazos de Claude Fable 5: guía de fallback para devs
Claude Fable 5 se re-despliega el 1 de julio con nuevos clasificadores de seguridad que suben los falsos positivos en tareas de código. En la API cruda un bloqueo es un stop_reason "refusal", no un fallback automático. Ruteo copy-paste a Opus 4.8, detección y monitoreo.
Leer →
Cómo Conectar un Agente de IA a Tus Datos y Herramientas: MCP + APIs (2026)
Dale a un agente de IA tus datos reales y poder de actuar: RAG para conocimiento, tool calling para datos y acciones en vivo, y MCP, el estándar abierto que cualquier agente usa.
Leer →
Cómo crear tu propio servidor MCP en Python (FastMCP, 2026): expón tus herramientas a cualquier cliente
Escribe un servidor MCP una vez y cualquier cliente — Claude Code, Claude for Desktop, el Agent SDK — usa tus herramientas. Tutorial en Python cargado de código: FastMCP, @mcp.tool(), recursos, transportes, cómo conectarlo y seguridad.
Leer →
Claude Agent SDK: cómo construir agentes de producción con "Claude Code como librería" (tutorial en Python)
Tutorial en español, cargado de código, sobre el Claude Agent SDK: instálalo, escribe tu primer agente con query() y ClaudeAgentOptions, usa las herramientas integradas, conecta tus propios servidores MCP y aprovecha hooks, subagentes, permisos y sesiones — con una explicación clara de cuándo usar el SDK frente a la API cruda de Claude, la CLI de Claude Code o los Managed Agents.
Leer →
Migra tu servidor MCP al spec stateless 2026-07-28 (antes de que salga)
El spec MCP 2026-07-28 se vuelve stateless: adiós al handshake initialize, las capabilities viajan en _meta por request. El plan de migración, los breaking changes y el timeline.
Leer →
Cómo asegurar un servidor MCP: checklist de blindaje para builders (con los CVE de 2026)
Checklist operativo para blindar los servidores MCP que conectas a tus agentes: CVE reales de 2026, las 5 familias de ataque y qué cerrar antes de tocar pagos.
Leer →
Cómo darle a un agente de IA la capacidad de cobrar con Stripe — de forma SEGURA — con el Agent Toolkit y una clave restringida (rk_)
Darle a un agente de IA acceso a tu cuenta de Stripe es una decisión de seguridad, no una feature. Instala el Stripe Agent Toolkit, acótalo con una clave restringida (rk_) con permisos para exactamente las acciones que necesita, conéctalo a tu framework y exige aprobación humana antes de mover dinero — para que un agente con prompt injection quede acotado. Código en TS y Python.
Leer →
Conecta tu agente al servidor MCP de Stripe (mcp.stripe.com): OAuth, las 14 herramientas y una configuración segura
Apunta cualquier cliente MCP al servidor hospedado de Stripe en mcp.stripe.com, autentícate con OAuth o una llave restringida rk_ como Bearer, y deja que tu agente cree payment links, facturas y reembolsos — sin que tú escribas el código de las herramientas. Configs, la lista de tools y la postura de seguridad que acota el radio de impacto.
Leer →
Inyección de prompt indirecta: cómo un atacante secuestra tu agente con tool calling (y las capas de defensa que sí lo frenan, Python 2026)
La inyección de prompt indirecta esconde instrucciones maliciosas en el contenido que tu agente LEE — una página, un PDF, un correo, la salida de una tool — y secuestra sus herramientas contra ti. Demo del ataque + las capas de defensa, con código Python y la allowlist determinista de tool calls.
Leer →
Cómo proteger un agente de IA que lee correo o WhatsApp: la defensa del allowlist de herramientas (Python, 2026)
Tu agente de IA lee correo o WhatsApp, así que un atacante le manda instrucciones. Esta es la defensa operativa: mantén el texto entrante fuera del canal de instrucciones y valida cada herramienta con un allowlist determinista en tu código, con Python que corre.
Leer →
Oculta CURP, RFC y CLABE antes de que lleguen al LLM: tutorial de Presidio para agentes de IA mexicanos
Paso a paso: oculta CURP, RFC, CLABE y teléfonos MX antes de que tu agente de IA mande texto a un LLM. Crea reconocedores Presidio y conéctalos como middleware.
Leer →
RAG vs Fine-Tuning: ¿Cuál Necesita Tu Negocio? (2026)
RAG le da hechos actuales al modelo; el fine-tuning moldea su comportamiento. Guía 2026 para decidir entre RAG, fine-tuning, ambos o solo un mejor prompt.
Leer →
Cómo Añadir un Chatbot de IA a tu Sitio Web que No Alucine (2026)
Guía práctica para añadir un chatbot de IA fundamentado que responde solo desde tu contenido real, cita fuentes, dice "no lo sé" y escala a un humano.
Leer →
Cómo crear un agente de IA en WhatsApp para tu negocio (Cloud API + Claude + RAG, 2026)
Meta prohibió los chatbots de propósito general en WhatsApp. Así se crea el tipo que sí permite: un agente de negocio específico, con RAG y Claude vía Cloud API.
Leer →
¿Cuánto cuesta integrar IA en tu app o SaaS? (Guía 2026)
Desglose honesto 2026 de lo que cuesta integrar IA en tu app: el costo de construir, el costo mensual de operar, precios reales de modelos y un ejemplo real.
Leer →
Agentes de IA vs Automatización (n8n, Zapier, Make): Cuándo Usar Cada Una en 2026
Guía honesta de un practicante sobre agentes de IA vs automatización en 2026: cuándo usar n8n, Zapier o Make, cuándo agregar un paso de IA y cuándo sí necesitas un agente.
Leer →
Autohospeda n8n y crea tu primer agente de IA con Claude
Autohospeda n8n con Docker y crea tu primera automatización de IA con Claude: credencial Anthropic, nodo AI Agent + herramienta, system prompt, costos y la verdad honesta sobre privacidad.
Leer →
Autohospedar n8n en producción: Docker Compose, PostgreSQL, HTTPS y queue mode
Guía para autohospedar n8n en producción. Por qué los defaults (SQLite, sin TLS, llave efímera) se rompen bajo carga, más un docker-compose.yml listo para copiar con PostgreSQL, las variables que importan (N8N_ENCRYPTION_KEY, WEBHOOK_URL), un reverse proxy para HTTPS, queue mode con workers en Redis, respaldos, actualizaciones y un checklist de seguridad.
Leer →
Qué es Cursor AI y cómo usarlo (2026): el editor con IA (fork de VS Code), de Tab al Agente
Cursor es un editor de código con IA nativa — un fork de VS Code de Anysphere donde tus extensiones, temas y atajos se conservan. Esta guía de ingeniero cubre qué es, cómo instalarlo desde cursor.com y cómo usar de verdad sus cuatro superficies de IA: Tab, Cmd+K edición en línea, Cmd+L chat y Cmd+I el Agente — más contexto con @, indexado del código, Rules, elección de modelo y precios.
Leer →
Llevar un LLM a producción: costo, latencia y guardarraíles (guía 2026)
El demo funcionó y producción se rompió. Guía a fondo para llevar un LLM a producción en 2026: costo, latencia, guardarraíles, evals y operación real.
Leer →
El harness mínimo de evals para un agente de IA en producción (casi nadie lo hace)
El 89% de los equipos observan sus agentes de IA pero solo el 37% los evalúan. Aquí está el harness mínimo de evals que puedes lanzar esta semana, en español.
Leer →
Structured Outputs de Claude en producción: JSON garantizado por esquema para extraer CFDI y enrutar webhooks
Structured Outputs de Claude llegó a GA el 4 feb 2026. La API exacta (output_config.format) y dos tareas de pagos que arregla: extraer CFDI y enrutar webhooks de Stripe/Mercado Pago.
Leer →
Baja la factura de tokens de tu agente Claude con prompt caching: tutorial práctico (2026)
Paso a paso: deja de pagar el precio completo de input cada turno. Dónde poner cache_control, los mínimos por modelo, la economía de lectura vs escritura y cómo verificar el hit.
Leer →
Cómo construir un sistema RAG con Claude (embeddings Voyage + pgvector, 2026)
Un tutorial práctico de principio a fin: divide tus documentos, genera embeddings con Voyage, guarda los vectores en pgvector, recupera los top-k para una pregunta y haz que Claude responda con fundamento y citas. Python y SQL reales que puedes ejecutar.
Leer →
Base de Datos Vectorial para RAG: pgvector vs Pinecone vs Qdrant (2026)
¿Qué base de datos vectorial usar para RAG? La regla primero: ya usas Postgres → pgvector; quieres administrado sin operar infra → Pinecone; open-source autohospedable → Qdrant; prototipo rápido → Chroma. Trade-offs reales, sin benchmarks inventados.
Leer →
Arregla un RAG que recupera los chunks equivocados: búsqueda híbrida + reranking (con métricas antes/después, 2026)
Tu RAG recupera chunks parecidos pero incorrectos. Arréglalo con búsqueda híbrida (denso + BM25), fusiona con RRF (k=60), reordena con Voyage rerank-2.5 al top-10 — y demuestra la mejora con Recall@k, MRR y NDCG en Python.
Leer →
Estrategias de chunking para RAG (y Contextual Retrieval de Anthropic): la guia del ingeniero
Como partes tus documentos decide lo que RAG podra encontrar: ningun reranker aguas abajo recupera un chunk mal cortado. Empieza con chunks recursivos de 512 tokens y 10-20% de solape, y luego usa Contextual Retrieval de Anthropic (antepon un contexto de 50-100 tokens generado por Claude antes de embeder e indexar con BM25) para reducir los fallos de recuperación hasta un 67%. Con Python.
Leer →
Chat en streaming y tool calling con Claude usando el Vercel AI SDK 7 (Next.js + TypeScript)
Guia en TypeScript para construir un chat en streaming con Claude y el Vercel AI SDK 7 en produccion: instala ai + @ai-sdk/anthropic + zod, transmite streamText desde un Route Handler de Next.js hacia useChat, agrega tool calling con inputSchema de Zod y execute, y acota el bucle con stopWhen. Cubre el detalle ESM-only de v7, el helper de stream renombrado, el cuidado con el model-id, y el manejo de errores/abort.
Leer →
Salidas estructuradas con Vercel AI SDK: generateObject + Zod + Claude (TypeScript)
Deja de parsear a mano el texto libre de un LLM. Define un esquema Zod, llama a generateObject con anthropic('claude-sonnet-5') y recibe un objeto tipado que cumple el esquema, con reparación automática cuando la salida es inválida. Incluye streamObject para UI progresiva, enums, esquemas anidados y extracción real de tickets/CFDI. AI SDK 7, TypeScript.
Leer →
Trabaja conmigo en esto
Preguntas frecuentes
- ¿Necesito un agente de IA o un workflow?
- La mayoría de los casos que la gente llama "agente" deberían ser workflows: pasos fijos con quizá un paso de IA para lo difuso. Reserva un agente real para cuando el camino no se puede predefinir y toleras variabilidad, costo y latencia.
- ¿RAG o fine-tuning?
- RAG le da al modelo conocimiento actual al momento de la consulta; el fine-tuning moldea el comportamiento (formato, tono), no los hechos. Para responder con datos de tu empresa, casi siempre quieres RAG, no fine-tuning.
- ¿Por qué mi chatbot alucina y cómo lo evito?
- Un modelo sin fundamentar responde desde su memoria de entrenamiento, así que inventa precios y políticas. Lo fundamentas con recuperación (RAG) para que solo responda desde tu contenido real, cite la fuente y diga "no lo sé" cuando no hay contexto.