¿Qué incluye una plataforma de IA de voz? Telefonía, TTS, STT, LLM y lo que aún tienes que aportar

¿Qué incluye una plataforma de IA de voz? Telefonía, TTS, STT, LLM y lo que aún tienes que aportar
VOLVER A LOS BLOGS
EN ESTA PÁGINA
Volver arriba

La mayoría de las plataformas de IA de voz agrupan cuatro piezas en un único precio por minuto: voz a texto, el modelo de lenguaje, texto a voz y la orquestación que las une en una llamada telefónica en tiempo real. La telefonía entra a través de SIP, pero los minutos del operador, los sistemas con los que habla tu agente y la propia lógica de la conversación siguen siendo tuyos.

Esa es la respuesta completa. El resto de esta guía es para compradores que se atascan una y otra vez en la misma pregunta de evaluación: «Espera, ¿necesitamos suscripciones separadas para telefonía, TTS, STT y LLM, o esto ya forma parte de la plataforma?»

Si te has sentado en una llamada con un proveedor comparando una plataforma de IA de voz en paralelo con Twilio, ElevenLabs u OpenAI y has preguntado cuál es más barata, este artículo es la respuesta más clara que vas a obtener. Esos proveedores no están en la misma columna. Cada uno vende una única capa del stack. Una plataforma como Retell AI vende el conjunto orquestado.

Saber qué capa está comprando tu dinero responde a cuatro preguntas prácticas:

  • Qué contratos firmas
  • Qué facturas recibes cada mes
  • Qué horas de ingeniería inviertes antes de ponerte en marcha
  • Qué partes del stack puedes cambiar cuando cambian los precios o los modelos

El stack de IA de voz de un vistazo

Todo agente de voz que descuelga un teléfono ejecuta la misma cadena. Entra el audio. Se transcribe. Un modelo razona sobre la transcripción. La respuesta se pronuncia de vuelta. Todo ello fluye en paralelo.

CapaQué haceProveedores habituales
TelefoníaEnruta el audio entre el teléfono y el servidorTwilio, Telnyx, Vonage, Avaya
Voz a texto (STT)Convierte el audio en textoDeepgram, AssemblyAI, Whisper
Modelo de lenguaje (LLM)Lee, razona, decide, respondeGPT-5, GPT-4o, Claude 4.5, Gemini 3.0
Texto a voz (TTS)Convierte el texto en audio habladoElevenLabs, Cartesia, OpenAI, MiniMax
OrquestaciónTransmite, almacena en búfer, gestiona los turnos y las llamadas a herramientasLa plataforma de IA de voz

Las primeras cuatro son commodities. Todo el mundo usa más o menos los mismos proveedores. La quinta es donde los equipos queman en silencio de tres a seis meses de ingeniería cuando intentan construirla ellos mismos.

El coste oculto de «lo montamos nosotros mismos»: WebSockets de streaming. Búfer por límites de frase. Detección de actividad de voz. Recuperación de interrupciones. Llamadas a funciones a mitad de llamada. Lógica de reintentos entre cuatro API. Integración SIP que gestione las peculiaridades del códec de 8 kHz. Nada de esto viene de serie.

¿Necesito suscripciones separadas para telefonía, TTS, STT y LLM?

No. No con una plataforma. Con una plataforma de IA de voz, firmas un acuerdo y recibes una factura. Con infraestructura en bruto, firmas cuatro.

En las evaluaciones reales aparecen tres vías de compra:

1. Plataforma empaquetada: Un contrato, una factura, un panel. Eliges una voz y un LLM en menús desplegables; la plataforma gestiona las licencias, las llamadas a la API y la medición. Esto es lo que la mayoría de los equipos eligen durante los primeros 90 días.

2. Infraestructura en bruto: Twilio + un proveedor de STT + una API de LLM + un proveedor de TTS, unidos con tu propio código de orquestación. Máximo control, cuatro juegos de credenciales, de tres a seis meses de ingeniería antes de atender una llamada real.

3. Híbrido con componentes propios: La plataforma gestiona la orquestación y los componentes, pero tú aportas tu propio trunk SIP, tu modelo afinado o tus claves de voz. Aquí es donde acaban la mayoría de los despliegues en producción tras el primer trimestre.

¿Qué incluye el precio por minuto?

La tarifa de titular de una plataforma cubre la orquestación. Los componentes se suman por encima, y son partidas transparentes, no cargos ocultos.

Así se desglosa una llamada típica de gama media en la página de precios:

ComponenteTarifa típicaNotas
Orquestación base~$0,07/minFija
Voz (Cartesia)~$0,05–$0,07/minElevenLabs/OpenAI salen más caras
LLM$0,003–$0,08/minGemini Flash el más barato, GPT-5 el más caro
Telefonía (integrada)~$0,015/minO $0 con tu propio trunk SIP
Total (típico)$0,13–$0,20/minVoz de gama media + modelo competente

Dos notas antes de que modeles esto para finanzas:

  • Un punto de entrada de $0,07 no es un coste de producción de $0,07. El titular cubre solo la orquestación.
  • Los complementos quedan fuera de la tarifa por minuto: base de conocimiento en streaming (gratis para las primeras diez, luego ~$0,005/min), concurrencia más allá de 20 llamadas, identificador de llamada con marca. Ninguno es obligatorio para arrancar.

¿La telefonía viene incluida o aún necesito Twilio?

Sí, y sí. Depende de lo que ya tengas.

Puedes comprar un número de teléfono directamente dentro del panel y empezar a atender llamadas en menos de una hora. También puedes aportar un número existente de Twilio, Telnyx, Vonage o Avaya mediante SIP trunking y saltarte al operador revendido por completo. Ambas vías usan la misma capa de orquestación por debajo.

Regla de decisión rápida:

  • ¿Empiezas de cero? Usa el número integrado. Más rápido, más barato, sin configuración de operador.
  • ¿Contrato de operador existente o números portados? Aporta tu propio trunk SIP. Conserva tus tarifas, tu atestación STIR/SHAKEN y tu cartera de DID.
  • ¿Ya metido de lleno en unaintegración con Twilio? La misma respuesta: apunta el trunk a la plataforma e importa el número.

Puedes cambiar más adelante. Reimportar un número lleva minutos, no planes de migración.

¿Tengo que pagar ElevenLabs por separado?

No. La voz que eliges en un menú desplegable está incluida en el precio por minuto.

Esto hace tropezar a muchas llamadas de evaluación porque ElevenLabs vende dos productos distintos:

  • Su propio producto de IA conversacional de extremo a extremo (vendido directamente, ~$0,10/min más los costes de LLM)
  • Sus modelos de voz, licenciados a plataformas que los integran y los revenden por minuto

Si usas una plataforma de IA de voz, obtienes el n.º 2. Sin clave de API separada. Sin suscripción separada. Sin factura separada. Las licencias y la medición ocurren en el backend.

La misma lógica se aplica a Cartesia, OpenAI TTS, MiniMax y los propios modelos de voz de la plataforma. La única excepción es la clonación de voz empresarial, que se configura por separado para equipos que necesitan una voz específica de marca.

¿Necesito una suscripción de OpenAI para el LLM?

No. La inferencia viene incluida. Eliges el modelo en un menú desplegable y el precio por minuto se ajusta:

  • Más barato: Gemini 3.0 Flash, GPT-5 Nano (fracciones de céntimo)
  • Gama media: GPT-4o, Claude Haiku
  • Con mucho razonamiento: Claude 4.5 Sonnet, GPT-5

Sin clave de API de OpenAI por tu parte. Sin cuenta de Anthropic. Sin proyecto de Google Cloud.

Si quieres aportar tu propio modelo (pesos afinados, un contrato de OpenAI Enterprise que ya hayas firmado, o un despliegue autoalojado de Llama), la plataforma admite un LLM personalizado por WebSocket. Los pasos de integración están en la documentación.

¿Cuándo es un modelo propio la opción adecuada?

  • Requisitos estrictos de residencia de datos
  • Compromisos de LLM existentes que quieras rentabilizar
  • Afinado específico de dominio que supere claramente a los modelos de propósito general en tu caso de uso

Para el resto, la vía empaquetada es más rápida de desplegar y más fácil de cambiar cuando llega un nuevo modelo.

Lo que aún tienes que aportar

Esta es la parte que pilla desprevenidos a los equipos. La plataforma gestiona la conversación. Tú gestionas el negocio al que sirve.

Tú aportasLa plataforma gestiona
El contenido de la base de conocimiento (tu catálogo de servicios, precios, horarios, políticas)La recuperación RAG y la sincronización automática
El CRM y el sistema de registroLas llamadas a webhooks durante la conversación
El calendario y el sistema de reservasLas comprobaciones de disponibilidad en tiempo real y la creación de eventos
El diseño del flujo de conversaciónEl framework de arrastrar y soltar para construirlo
Las reglas de escalado y enrutamientoLa transferencia asistida con contexto completo

Algunas notas que merece la pena destacar:

  • La base de conocimiento se sincroniza automáticamente desde tu sitio web o conjunto de documentos, pero el contenido de esos documentos es tuyo y debes mantenerlo al día. Basura entra, basura sale, igual que en cualquier sistema RAG.
  • La integración con el CRM se realiza mediante webhooks, Make, n8n, Zapier o una integración nativa con HubSpot. El agente puede leer y escribir en Salesforce o HubSpot durante una llamada en vivo, pero el esquema y los permisos residen en ti.
  • Para los flujos de concertar citas, la integración se ejecuta contra Cal.com, Google Calendar, Calendly o el sistema de reservas que albergue tu calendario de referencia.
  • Existen plantillas para patrones comunes como agente de programación de citas con IA, servicio de contestador con IA, soporte entrante, pero las preguntas concretas que hace tu agente y qué cuenta como «lead cualificado» son decisiones que solo tú puedes tomar.
  • Para los escalados con transferencia de llamadas, tú defines el umbral. Los despliegues en producción automatizan de forma habitual hasta el 80 por ciento de las llamadas entrantes, pero dónde trazas la línea entre IA y humano lo decides tú.

Empaquetar vs. construir: la comparación honesta

La brecha de coste es pequeña. La brecha de tiempo es enorme.

Plataforma empaquetadaConstrucción con componentes propios
Relaciones con proveedores14+
Tiempo hasta la primera llamada en vivoMenos de una hora3–6 meses
Coste cargado por minuto$0,13–$0,20$0,13–$0,31
Ingeniería requeridaDiseño de prompts + flujosPipeline de streaming + lógica de reintentos + observabilidad + gestión de SIP
Cadena de cumplimientoUn único BAAUno por cada proveedor del stack

Una construcción típica con componentes propios recurre a Twilio para la telefonía, Deepgram o AssemblyAI para la transcripción, GPT-5 o Claude 4.5 para el razonamiento, ElevenLabs o Cartesia para la voz, y Pipecat o LiveKit para la orquestación. El cálculo por minuto acaba más o menos en el mismo vecindario que una plataforma empaquetada.

Lo que pagas cuando construyes es tiempo de ingeniería. Detección de actividad de voz, gestión de interrupciones, llamadas a funciones que sobreviven a fallos a mitad de llamada, observabilidad que correlaciona cuatro paneles de proveedores en una sola traza, e integración SIP que gestione con elegancia las peculiaridades del códec de 8 kHz del audio de telefonía. Nada de esto viene de serie.

La mayoría de los modelos de transcripción modernos se entrenan principalmente con audio de 16 kHz. La telefonía te entrega 8 kHz. La brecha de precisión en un pipeline recién construido es real y perceptible para quien llama.

Esa brecha entre meses de fontanería y días de ingeniería de prompts es la razón por la que la mayoría de los agentes de voz en producción en 2026 se despliegan sobre una plataforma.

Dónde están los límites

Twilio, ElevenLabs, OpenAI y Retell AI no compiten por el mismo dólar. Son capas apiladas en la misma arquitectura:

  • Twilio, Telnyx, Vonage → telefonía. Mueven audio entre teléfonos y servidores.
  • ElevenLabs, Cartesia, OpenAI TTS, MiniMax → síntesis de voz. Convierten texto en habla.
  • OpenAI, Anthropic, Google → inferencia de modelos de lenguaje. El cerebro que razona.
  • Retell AI → orquestación más el framework de agentes, el análisis posterior a la llamada, las llamadas por lotes, las pruebas de simulación y la envoltura comercial que convierte cuatro facturas en una.

El marco correcto rara vez es «Retell o Twilio». Es «Retell sobre Twilio». Lo mismo con OpenAI y ElevenLabs. El único solapamiento real está en la capa de orquestación, y la página Retell vs ElevenLabs cubre esa comparación más acotada para equipos que eligen entre una plataforma y el propio producto de extremo a extremo de ElevenLabs.

¿Qué pasa con HIPAA, SOC 2 y GDPR?

El cumplimiento reside en la capa de plataforma. SOC 2 Type II, HIPAA con un BAA de autoservicio y GDPR vienen incluidos sin recargos de cumplimiento por minuto.

Donde esto importa más es en la construcción sin paquete. El cumplimiento no se detiene en la orquestación en un stack montado a mano. Cada proveedor de la cadena (STT, LLM, TTS, telefonía) tiene su propio proceso de BAA, sus propios términos de tratamiento de datos y su propia pista de auditoría. Los equipos de compras en sanidad, seguros y servicios financieros suelen elegir el paquete solo por esa razón.

La aprobación de un proveedor se mueve más rápido que la de cuatro.

Cómo rinde el paquete en producción

Tres despliegues hacen el compromiso más concreto:

Anker: Automatización de voz en centros de soporte globales que gestionan millones de llamadas al año en Norteamérica, Europa y Asia. Los agentes alcanzan más del 95 % de precisión en el reconocimiento de voz en los mercados de habla inglesa, funcionando sobre la telefonía existente de Anker en lugar de un pipeline de cuatro proveedores.

Medical Data Systems: Operaciones de cobros a través de la plataforma. El equipo ahora gestiona el 100 % de las llamadas entrantes con solo una tasa de transferencia del 30 %, cobrando unos 280 000 dólares al mes. Esa tasa de transferencia del 30 % es una decisión de negocio, no un valor por defecto de la plataforma.

Matic Insurance: Bot de operador fuera de horario que gestiona soporte, confirmación de citas y admisión. En el primer trimestre, el bot gestionó unas 8000 llamadas, con tasas de respuesta que superaron la referencia liderada por humanos. El bot funciona sobre la relación existente de Matic con Twilio.

El patrón en los tres casos:

  • La plataforma es dueña de la capa de agente
  • Los sistemas existentes del cliente son dueños de los datos y los flujos de trabajo
  • La relación con el operador es un contrato aparte

Esa es la línea entre empaquetar y aportar los componentes propios en despliegues reales de producción.

Preguntas frecuentes

¿Necesito una suscripción de ElevenLabs para usar una plataforma de IA de voz?

No. Las voces vienen integradas en el precio por minuto. La excepción es la clonación de voz empresarial, que se configura por separado.

¿Es Twilio necesario para operar un agente de voz con IA?

No. La mayoría de las plataformas admiten Telnyx, Vonage, Avaya y cualquier operador compatible con SIP mediante trunking directo, además de sus propios números integrados. Twilio domina la conversación solo porque es el operador existente más común.

¿Puedo aportar mi propio LLM?

Sí. Los LLM personalizados se admiten mediante una integración por WebSocket, incluidos los contratos de OpenAI Enterprise, la API de Anthropic, Gemini y modelos autoalojados. Pagas a tu proveedor de modelo por la inferencia y a la plataforma por la orquestación.

¿Cómo se compara el precio empaquetado con una construcción DIY sobre Twilio + OpenAI + ElevenLabs?

Los costes totales cargados acaban más o menos en el mismo rango: entre $0,13 y $0,31 por minuto. La economía por minuto no es el factor decisivo. El factor decisivo es el tiempo de ingeniería ahorrado en la capa de orquestación, que suele ser de meses.

¿Qué incluye la capa de orquestación?

Transmisión de audio en fragmentos, búfer por límites de frase entre el modelo de lenguaje y el TTS, gestión de turnos e interrupciones, llamadas a funciones durante una llamada en vivo, reintentos y failover entre las API subyacentes, pruebas de simulación, transcripciones con puntuación de sentimiento y un panel de observabilidad unificado.

¿Puedo usar una plataforma de IA de voz para llamadas salientes a escala?

Sí. Las llamadas por lotes admiten campañas salientes con 20 llamadas simultáneas gratis en cada cuenta. Los casos de uso comunes incluyen telemarketing con IA, cualificación de leads, seguimiento de gestión de cobros y recordatorios de citas. El cumplimiento de TCPA y STIR/SHAKEN se configura a nivel de operador.

¿Qué pasa cuando el agente no puede gestionar una llamada?

Transferencia asistida con contexto completo de la conversación. La persona que la recibe ve la transcripción y los datos estructurados que recopiló el agente, de modo que quien llama no tiene que repetirse. Los umbrales de escalado (intentos fallidos de aclaración, temas sensibles, peticiones explícitas de quien llama) se configuran por agente.

¿Es la plataforma apta para sectores regulados?

Sí. SOC 2 Type II, HIPAA con un BAA de autoservicio, GDPR y la redacción de PII vienen incluidos. El despliegue on-premise está disponible para equipos con requisitos estrictos de residencia de datos.

¿Cuánto se tarda desde el registro hasta un agente en vivo?

La mayoría de los equipos tienen una llamada de prueba funcionando en una hora y un agente listo para producción en 1–2 semanas. La plataforma procesa más de 50 millones de llamadas al mes en más de 3000 empresas, así que la vía de despliegue está muy trillada.

La decisión de compra en un párrafo

Las cuatro piezas en tiempo real (telefonía, transcripción, modelo de lenguaje, síntesis de voz) se están convirtiendo en commodities a toda velocidad. Cualquiera puede comprarlas. La orquestación que las convierte en una llamada telefónica que dejarías oír a un cliente es donde se compone la ingeniería, y es por lo que una cuota de plataforma por minuto merece la pena en 2026.

La forma más rápida de percibir dónde está la línea es hacer una llamada real. El registro de Retell AI incluye $10 en créditos de uso, suficiente para desplegar un agente de prueba contra tu propio número y ver dónde encajan tus sistemas existentes frente a lo que la plataforma gestiona de extremo a extremo.

A partir de ahí, el siguiente paso natural es el flujo de trabajo que más te importe:

Construye con los $10 en créditos en retellai.com.

Calculadora de ROI
Estima tu ROI al automatizar las llamadas

Descubre cuánto podría ahorrar tu empresa al pasar a agentes de voz impulsados por IA.

¡Listo! 
Tu envío se ha mandado a tu correo electrónico
¡Vaya! Algo salió mal al enviar el formulario.
   1
   8
20
¡Vaya! Algo salió mal al enviar el formulario.

Resultado del ROI

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Demo en Directo
Prueba Nuestra Demo en Directo

Un número de teléfono de demostración de Retell Clinic Office

¡Gracias! ¡Tu envío ha sido recibido!
¡Vaya! Algo salió mal al enviar el formulario.

Read Other Blogs

Revolutionize your call operation with Retell