Cuánto cuesta un agente de IA por tarea: la ecuación que casi nadie calcula
Los agentes de IA son baratos por token y caros por tarea: la bola de nieve de contexto multiplica la factura. La ecuación de costo por tarea y 6 palancas para gobernarlo.
Los agentes de IA son baratos por token y caros por tarea. Un token cuesta fracciones de centavo, pero una tarea ejecutada por un agente puede costar centavos… o dólares, según cuánto contexto acumule, cuántos pasos dé y qué modelo use. La cifra que debes vigilar no es el precio por millón de tokens de tu proveedor, sino el costo por tarea terminada: (tokens de entrada × relecturas × pasos) + tokens de salida + reintentos + revisión humana. Un agente sin gobernar cuesta fácilmente 10-100 veces más que uno bien diseñado haciendo el mismo trabajo. Aquí está la ecuación completa y las seis palancas que usamos en Mintec para que un agente cueste lo que debe costar.
Por qué tu factura crece aunque los tokens bajen de precio
Los precios por token llevan meses cayendo, y las facturas de agentes siguen subiendo. No es una paradoja: son dos números distintos. Un estudio del Stanford Digital Economy Lab (mayo 2026) sobre consumo de tokens en tareas agénticas encontró que una tarea ejecutada por un agente consume hasta 1,000 veces más tokens que la misma consulta en un chat.[1] El motivo es estructural: un agente lee la tarea, ejecuta una acción, y antes de la siguiente tiene que volver a leer todo lo anterior — prompt original + respuestas + resultados —. En el paso veinte está releyendo los diecinueve anteriores. Los autores lo llaman "una bola de nieve de contexto bien cara", y el costo alto está en los tokens de entrada, no de salida.[1]
El dato que más debería preocuparte: al ejecutar el mismo agente sobre la misma tarea, el costo varió hasta 30 veces entre ejecuciones, y ni el propio modelo puede predecir cuánto va a gastar.[1] Esto explica por qué los lanzamientos de modelos de julio 2026 (GPT-5.6 y Grok 4.5) dejaron de vender "el mejor score del benchmark" y empezaron a vender "menos tokens por tarea": OpenAI reporta que su tier Sol supera a Claude Opus 4.8 usando 85% menos tokens de salida, y xAI anuncia "2x eficiencia de tokens" contra la competencia.[2] Cuando el costo de tus clientes lo domina el consumo por tarea, "más barato por token" deja de ser el argumento de venta.
En el mundo empresarial, la otra cara del problema es el token maxing: usar el modelo más caro para todo, sin routing ni visibilidad. El caso que circuló en mayo: Uber dio acceso de Claude Code a 5,000 ingenieros en diciembre 2025 y en abril 2026 ya había quemado todo su presupuesto anual de IA.[3] La brecha entre el modelo más barato y el más caro del mercado es de ~4,500x (de $0.04 a $180 por millón de tokens), y el consumo global de tokens creció 13x desde enero 2025.[3] Nuestro problema en las pymes no es de esa escala, pero el mecanismo es idéntico: la factura de OpenAI de $30 se convierte en $300 el mes en que un workflow empieza a llamar al modelo equivocado en un loop sin límite.
La ecuación del costo por tarea
Cuando cotizamos una automatización con agentes, calculamos así:
Costo por tarea = (T_in × R × N) × P_in + (T_out × P_out) + reintentos + revisión humana + infra
| Variable | Qué significa | Impacto típico |
|---|---|---|
| T_in | Tokens de entrada que envías (contexto) | La palanca más grande: la bola de nieve la domina |
| R | Relecturas por paso (el agente relee todo su contexto) | 2-3x en agentes de 2-5 pasos; más en agentes largos |
| N | Número de pasos/herramientas que ejecuta | Cada paso multiplica T_in por R |
| P_in / P_out | Precio por millón de tokens del modelo | Hasta 4,500x de diferencia entre extremos |
| Reintentos | Ejecuciones fallidas que se repiten | 10-30% de la factura si no hay topes |
| Revisión humana | Tiempo de una persona revisando salidas | El costo oculto que nadie suma |
El error clásico es cotizar solo P. Dos workflows pueden resolver el mismo problema con la misma calidad y diferir 17x en costo por tarea solo por arquitectura: en los benchmarks de agentes de julio 2026, Grok 4.5 resolvía una tarea con 15,954 tokens de salida (~$0.096) contra 67,020 de Opus 4.8 (~$1.68) — y eso contando solo la salida, cuando la entrada suele dominar la factura.[2]
Lo que vimos en implementaciones reales: 5 niveles de costo por tarea
En los stacks que implementamos (n8n + APIs de LLM + Clientify), los agentes caen en cinco niveles de costo por tarea. Estos rangos salen de nuestras implementaciones de los últimos meses, no de folletos de proveedores:
| Nivel | Tipo de agente | Costo por tarea | Ejemplo real |
|---|---|---|---|
| 1 | Reglas deterministas (sin IA) | $0 | Rutear lead por país o por origen |
| 2 | Clasificación con modelo compacto | $0.002-$0.02 | Clasificar intención de un lead o tipo de ticket |
| 3 | Generación con modelo medio | $0.02-$0.15 | Resumen de conversación, respuesta personalizada |
| 4 | Agente con RAG + herramientas | $0.15-$1.00 | Soporte con base de conocimiento que consulta el CRM |
| 5 | Agente autónomo multi-paso | $1-$10+ | Flujo que investiga, decide entre opciones y ejecuta |
Referencia práctica: en nuestro pipeline de generación de leads con n8n, ~5,000 clasificaciones mensuales cuestan $20-40 de API — entre $0.004 y $0.008 por clasificación.[4] Ese mismo volumen disparado contra un modelo frontera sin routing costaría $0.10-0.50 por llamada: 25-100 veces más, para el mismo resultado. La conclusión incómoda: el costo por tarea es una decisión de arquitectura, no un precio de mercado.
Seis palancas para gobernar el costo (y no matar la calidad)
Sintetizamos las siete palancas del playbook de gestión de costos de IA de Correlation One (julio 2026) con lo que funciona en stacks pequeños:[5]
1. Routing de modelos por tarea. La palanca más grande: enviar cada tarea al modelo más barato que la resuelva bien. Nuestra tabla de referencia para automatización de negocio (precios as of septiembre 2026):
| Tarea | Modelo adecuado | Ejemplos de precio por M tokens |
|---|---|---|
| Clasificar, rutear, extraer | Compacto (Gemini Flash, GPT-5.6 Luna, DeepSeek) | $0.05-1 entrada |
| Resumir, reescribir | Medio (Grok 4.5, GPT-5.6 Terra) | $1-3 entrada / $6-15 salida |
| Redactar respuesta final al cliente | Medio-alto | $2.50-15 salida |
| Decisión compleja o crítica | Frontera solo en el paso final (GPT-5.6 Sol, Opus, Fable) | $5-50 salida |
2. Disciplina de contexto. Cada token de entrada se paga; enviar el registro completo del CRM cuando solo necesitas tres campos es regalar dinero en cada relectura. Si un agente necesita el historial de la conversación, resúmelo a lo esencial — el mismo principio que aplicamos a la memoria de agentes.
3. Límites de pasos y criterios de terminación. Todo agente debe declarar qué es "terminado" y qué es "falló", con un tope duro de pasos. Un agente que no sabe cuándo parar no tiene límite de gasto.
4. Caché de prompts y batch. Los proveedores descuentan hasta 90% los tokens de entrada cacheados (prompt caching) y hay tarifas reducidas para procesamiento por lotes. Para rutinas nocturnas (enriquecer 500 contactos), el batch convierte el costo en una fracción.
5. Reintentos con fallback a reglas. Topes de reintentos y degradación: si el modelo falla dos veces, que una regla tome el control en vez de reintentar contra el modelo caro. Es la misma separación construir con IA, ejecutar con reglas que aplicamos como arquitectura.
6. Gates de revisión humana. Las aprobaciones no solo protegen de errores: protegen el presupuesto. Un agente que necesita aprobación para acciones de alto impacto no puede entrar en un loop de gasto. Como decimos en permisos de agentes: gobernado es más barato.
El lema de Correlation One lo confirma: "los agentes bien gobernados son agentes más baratos".[5] En nuestra experiencia el routing solo recorta 60-80% del gasto en API sin tocar la calidad.
Lo que esto significa para una pyme en LatAm
El stack modular — generación de leads con n8n, Clientify, APIs de LLM — cuesta $26-209/mes por diseño. Eso se mantiene solo si gobiernas tokens. En dólares caros para la región, un agente que multiplica su costo 30x entre ejecuciones y nadie lo vigila convierte una automatización rentable en un gasto que hay que apagar. Y cuidado con la dirección contraria: si el costo por tarea te asusta, primero aplica las palancas y después decide. Muchos procesos ni siquiera necesitan agente (ver cuándo no usar IA), y los rangos de precios de chatbot para pymes ya cubren la mayoría de los casos de soporte simple.[6]
Plan de esta semana: (1) mide el costo por tarea de cada workflow con logs de la API, no con la factura total; (2) pon una alerta de gasto por workflow; (3) aplica la tabla de routing; (4) define criterios de terminación y tope de pasos; (5) revisa las 5 ejecuciones más caras cada semana. El costo debe ser una dimensión de test de tus agentes, igual que la precisión: un agente que responde bien 10x más caro de lo esperado tiene un defecto de diseño, no un problema de presupuesto.
Fuentes
- Stanford Digital Economy Lab, "How are AI agents spending your tokens?" (mayo 2026) — paper "How Do AI Agents Spend Your Money?" (Bai, Huang, Wang, Sun, Mihalcea, Brynjolfsson, Pentland, Pei): digitaleconomy.stanford.edu/news/how-are-ai-agents-spending-your-tokens/
- Nerd Level Tech, "AI Agent Token Costs in 2026: Cheap Tokens, Costly Tasks" (julio 2026) — pricing y benchmarks de GPT-5.6 y Grok 4.5: nerdleveltech.com/ai-agent-token-cost-per-task
- elvex, "AI Token Cost Enterprise: Stop Budget Blowouts in 2026" (mayo 2026) — caso Uber, brecha 4,500x, Deloitte CFO guide: elvex.com/blog/ai-token-cost-enterprise-budget-control
- Mintec, implementaciones de agentes de generación de leads con n8n (2026) — datos de stack propios.
- Correlation One, "How to Manage AI Token Costs in the Enterprise: The 2026 Playbook" (julio 2026): correlation-one.com/blog/how-to-manage-ai-token-costs-in-the-enterprise-the-2026-playbook
- Mintec, "De chatbot básico a agente de IA: cuándo saltar las pymes" (julio 2026), ai-chatbots-local-businesses-cost-framework.
Preguntas Frecuentes
¿Cuánto cuesta un agente de IA por tarea?
Entre fracciones de centavo y varios dólares por tarea, según el modelo, el contexto acumulado y los pasos ejecutados. Un agente de clasificación bien gobernado cuesta $0.005-$0.02 por tarea; un agente multi-paso con RAG y herramientas puede superar $1. El costo depende de los tokens por tarea, no del precio por token.
¿Qué es el token maxing?
Usar el modelo más caro y capaz para todas las tareas sin importar su complejidad. Con una brecha de hasta 4,500x entre el modelo más barato y el más caro, es la causa principal de facturas de IA descontroladas: el 60-80% del gasto se puede recortar con routing de modelos.
¿Cómo reduzco el costo de mis agentes de IA?
Seis palancas: routing de modelos por tipo de tarea, disciplina de contexto (enviar solo lo necesario), límites de pasos con criterios de terminación, caché de prompts y procesamiento batch, reintentos con fallback a reglas, y gates de revisión humana. Un agente gobernado cuesta una fracción de uno suelto.



