Agente de voz con IA en n8n: la arquitectura DIY con Twilio, Deepgram y ElevenLabs
automation 1 de septiembre de 2026 · Mintec

Agente de voz con IA en n8n: la arquitectura DIY con Twilio, Deepgram y ElevenLabs

Tu propio agente de voz con IA cuesta ~$0.10/min. Arquitectura real con Twilio, Deepgram, ElevenLabs: latencia, costos y cuándo no conviene construirlo.

Sí, puedes construir tu propio agente de voz con IA por menos de $0.10 por minuto de llamada, y no necesitas un equipo de ingenieros para operarlo. La pila es Twilio para la telefonía, Deepgram para transcribir lo que dice el cliente, un LLM para decidir la respuesta y ElevenLabs para hablar de vuelta, con n8n orquestando todo lo que ocurre alrededor de la conversación. Es la misma arquitectura que usamos en implementaciones con clientes, y en este artículo te muestro cómo se arma, el presupuesto de latencia que separa un agente natural de uno robótico y, más importante, cuándo no deberías construirlo. Si aún no has leído el panorama completo de agentes de voz para negocios, empieza ahí; esto es el nivel técnico.

Lo que cuesta un minuto real de conversación

Antes de arquitectura, hablemos de dinero: la mayoría de las comparativas mezclan precios de planes con precios por minuto. Estos son los precios públicos de cada pieza (septiembre de 2026):

ComponentePrecioNotas
Telefonía entrante (Twilio, número local US)$0.0085/min + $1.15/mesTarifa pública de Twilio para llamadas entrantes
Transcripción streaming (Deepgram Nova-3)$0.0077/minFacturación por segundo, latencia <300ms
Texto a voz (ElevenLabs Flash v2.5, API)~$0.05/min1.000 caracteres ≈ 1 minuto de habla; ~75ms de latencia
LLM (OpenAI o Claude)$0.01–0.05 por conversaciónDepende de turnos y tamaño de contexto
Orquestación (n8n self-hosted)$6–20/mesUn VPS pequeño alcanza

Sumando los variables, cada minuto de conversación cuesta entre $0.07 y $0.13; redondeando, $0.10 por minuto. Una clínica, un taller o una agencia de servicios con 1.000 minutos mensuales paga entre $80 y $130, todo incluido. El mercado llega a la misma cifra: el costo promedio de un agente de voz con IA se estima en ~$0.08/min, contra $7.16 por llamada atendida por un humano (CloudTalk, citando datos de ElevenLabs/ContactBabel).

Y el lado de la oportunidad no es cosmético: según el dataset de NextPhone sobre 1.4 millones de llamadas, el 28.5% llegan fuera del horario laboral y el 34.8% de esos llamantes de madrugada tienen intención de compra. A 100 llamadas al mes, son ~10 compradores que encontraron una contestadora.

El error de asumir que n8n maneja el audio

El consejo técnico más honesto de este artículo: n8n no es el mejor lugar para el loop de audio en tiempo real. Una llamada con agente de voz tiene dos planos que casi siempre se confunden:

  1. El plano de medios: el audio viaja de Twilio a Deepgram para transcribirse, y de ElevenLabs de vuelta a teléfono. Aquí los milisegundos importan y los websockets mandan.
  2. El plano de orquestación: qué pasa antes, durante y después de la llamada — buscar el contacto en el CRM, decidir si se agenda o se cotiza, actualizar el registro, disparar el seguimiento.

n8n vive en el segundo plano y ahí brilla. Los equipos que intentan meter todo el audio dentro de n8n terminan con websockets caseros frágiles, reinicios de workflow en medio de conversaciones y latencias de 3-4 segundos que hacen colgar al cliente. El flujo correcto es elegir primero cómo se maneja el audio y después conectar n8n a los eventos de la llamada.

Dos patrones de construcción

Para el plano de medios hay dos caminos reales, y la decisión entre ellos define todo lo demás:

PatrónLatencia por turnoComplejidadCuándo usarlo
TwiML Gather + webhook1.5–3sBaja (solo n8n)Calificación simple, 30–100 llamadas/mes, flujo guionado
Media Streams + websocket0.5–1sMedia (servidor de medios + n8n)Conversación natural, atención 24/7, clientes que exigen velocidad

Patrón 1, el sencillo: Twilio usa un verbo TwiML <Gather> con reconocimiento de voz; cuando la persona termina de hablar, Twilio envía el texto a un webhook de n8n; n8n consulta al LLM y Twilio reproduce la respuesta con <Say> (ElevenLabs va por API). Es literalmente un workflow de n8n con tres nodos y funciona. El costo asumido es la latencia: cada turno suma 1-2 segundos de ida y vuelta, y la conversación se siente como hablar por radio. Para "¿cliente nuevo o existente?" es aceptable; para "¿qué necesitas hoy?" se nota.

Patrón 2, el natural: Twilio Media Streams abre un websocket hacia un pequeño servidor de medios (Python o Node, ~200 líneas) que encadena Deepgram en streaming, el LLM y ElevenLabs con corte de audio bidireccional. Aquí el cliente puede interrumpir, el agente responde en menos de un segundo y la conversación fluye. n8n no está en ese camino: escucha los webhooks de estado de la llamada, resuelve el contexto del cliente y ejecuta las acciones. Es el patrón que usamos cuando el agente sustituye a una recepcionista de verdad.

Ambos comparten el mismo cerebro: el prompt del sistema que define el personaje, el tono y las reglas de negocio. Esa parte sí vive en n8n y se prueba ahí.

El presupuesto de latencia: por qué tu agente suena a robot

La queja #1 de los clientes no es que el agente diga tonterías: es que tarda. La latencia se acumula y el oído humano perdona muy poco:

EtapaLatencia típica
STT streaming (Deepgram)150–300ms
LLM hasta el primer token200–400ms
TTS primero byte (Flash v2.5)75–135ms
Red20–200ms
Total~0.5–1.0s

Los benchmarks del sector (VAQI, citado por Deepgram en su guía de agentes de voz en tiempo real) sitúan el umbral de lo que suena natural por debajo de 300ms, aceptable entre 300 y 600ms, y robótico por encima de 1 segundo. La conclusión práctica, que coincide con lo que vemos en producción: el LLM es la variable más grande y la menos predecible. En la guía oficial de ElevenLabs para construir agentes con Twilio lo dicen igual: la parte exacta donde se pierde el presupuesto de latencia casi siempre es el LLM.

Tres reglas que aplicamos en cada implementación:

  1. Modelo rápido y contexto corto: un modelo conversacional ágil con el historial resumido pesa menos que un modelo gigante con el contexto completo. Un turno de 300-500ms de LLM vale más que el 5% extra de calidad.
  2. Transcribe en streaming, no por lotes: si esperas a que termine la frase para enviar el audio, ya perdiste. Deepgram en streaming entrega hipótesis parciales en ~150ms.
  3. Traza cada llamada: identifica cada llamada con un ID de correlación y registra los timestamps de las etapas (fin de STT, primer token del LLM, primera pieza de audio). Cuando un cliente dice "suena lento", el log te dice si fue el LLM, la red o la cola de audio. Sin esa traza, vas a adivinar.

n8n como director de orquesta: el ciclo de vida de la llamada

Una vez resuelto el audio, el agente se convierte en un workflow de eventos. El patrón que repetimos en cada cliente:

  1. Llamada entrante: Twilio notifica a n8n; el workflow busca el número en el CRM (Clientify por API) y arma el contexto: ¿es cliente, lead o desconocido?
  2. Durante la conversación: n8n recibe el transcript y las intenciones detectadas; decide acciones (agendar cita, enviar cotización, transferir).
  3. Transferencia a humano: regla de oro — palabra clave, tres giros sin resolver o error del LLM disparan <Dial> hacia el agente humano. La transferencia es un éxito del sistema, no una falla: en el dataset de NextPhone, el 73.8% de las llamadas resueltas se enrutaron correctamente al destino.
  4. Cierre y seguimiento: resumen de la llamada al CRM, tarea creada para ventas, y si aplica, continuación por WhatsApp con contexto completo — el patrón híbrido que ya documentamos.

Tres advertencias de producción que aprendimos a las malas: prueba los workflows AI-generados en entornos separados antes de tocar producción (la regla de tres entornos que cubrimos en asistente de IA para workflows en n8n); define qué pasa si el STT devuelve basura (retry, transferencia, o repetir la pregunta — nunca enviar texto vacío al LLM); y monitorea el costo por llamada en el primer mes, porque los tokens del contexto se inflan rápido. Si tu agente va a manejar datos de pacientes o clientes auditables, el self-hosting de la orquestación no es opcional, es el argumento principal del proyecto.

Construir o comprar: la decisión que casi nadie toma bien

Lo que las guías de "build your own voice agent" no te dicen: para la mayoría de los negocios, comprar es la respuesta correcta. Los SaaS que ya comparamos en plataformas de agentes de voz resuelven el 80% de los casos por $50-400/mes, con español latino de verdad (Fonema tiene 200+ voces regionales con latencia <1.2s) y sin que toques un servidor. Construir es racional solo en un subconjunto de casos:

SeñalCompra SaaSConstruye DIY
Números/líneas1 número3+ líneas o varios clientes (agencias)
IntegracionesEstándar (agendar, transferir)CRM + WhatsApp + facturación a la medida
Volumen<1.000 min/mesAlto, o creciendo sin tope de concurrency
DatosSin restriccionesSensibles, regulados, o preferencia de soberanía
EquipoSin técnico internoAlguien que mantenga n8n y el servidor de medios

En la práctica, el case de negocio más sólido que hemos visto es el de agencias: un build único se replica en N clientes y el costo marginal por agente nuevo es de horas, no de meses. Para un solo negocio, la matemática casi nunca cierra frente a un SaaS.

Lo que aprendimos implementándolos

Cerrando con lo que solo se aprende construyendo: el 80% del esfuerzo no está en el código, está en la voz y en el guion. Los tres frentes que más tiempo consumen en implementaciones reales son la calidad del español (los acentos regionales destrozan los STT entrenados en neutro — prueba con grabaciones reales de tu mercado, no con tu propia voz), el manejo de interrupciones (el barge-in mal calibrado corta frases al cliente y lo frustra más que la lentitud) y el monitoreo (el primer mes hay que revisar transcript + resumen + costo de cada llamada, como harías con cualquier canal nuevo). Si algo de esto te suena a mantenimiento que no quieres hacer, esa es la señal más fuerte para comprar. Si quieres el control total, construir tu chatbot primero es el mejor entrenamiento: el agente de voz comparte el mismo cerebro, solo cambia la boca y los oídos. Y si prefieres que un equipo con experiencia lo arme, automatización y chatbots es el servicio que hacemos todos los días.

Preguntas Frecuentes

¿Cuánto cuesta construir un agente de voz con IA en n8n?

La infraestructura cuesta $6-20/mes (VPS para n8n) más unos $0.07-0.13 por minuto de llamada entre Twilio, Deepgram y ElevenLabs, más $0.01-0.05 por conversación de LLM. Un negocio de 1.000 minutos al mes paga entre $80 y $130 mensuales (precios públicos de septiembre 2026).

¿n8n puede manejar el audio de la llamada en tiempo real?

No es el mejor lugar para el loop de audio: n8n orquesta lo que rodea a la llamada (webhooks, CRM, transferencias, seguimiento), pero el audio en tiempo real viaja por websockets. Para flujos simples funciona el patrón TwiML Gather + webhook; para conversación natural se usa Twilio Media Streams con un pequeño servidor de medios.

¿Cuándo NO conviene construir mi propio agente de voz?

Con un solo número y un flujo estándar de recepción, comprar un SaaS (NextPhone, Kosmo, Fonema) es más barato y rápido. Construir paga cuando tienes 3+ líneas o clientes múltiples, necesitas integración profunda con tu CRM y WhatsApp, tienes volumen alto o manejas datos sensibles que prefieres no enviar a plataformas de terceros.

Artículos Relacionados