La mayoría de las plataformas de IA de voz agrupan cuatro piezas en un único precio por minuto: voz a texto, el modelo de lenguaje, texto a voz y la orquestación que las une en una llamada telefónica en tiempo real. La telefonía entra a través de SIP, pero los minutos del operador, los sistemas con los que habla tu agente y la propia lógica de la conversación siguen siendo tuyos.
Esa es la respuesta completa. El resto de esta guía es para compradores que se atascan una y otra vez en la misma pregunta de evaluación: «Espera, ¿necesitamos suscripciones separadas para telefonía, TTS, STT y LLM, o esto ya forma parte de la plataforma?»
Si te has sentado en una llamada con un proveedor comparando una plataforma de IA de voz en paralelo con Twilio, ElevenLabs u OpenAI y has preguntado cuál es más barata, este artículo es la respuesta más clara que vas a obtener. Esos proveedores no están en la misma columna. Cada uno vende una única capa del stack. Una plataforma como Retell AI vende el conjunto orquestado.
Saber qué capa está comprando tu dinero responde a cuatro preguntas prácticas:
Todo agente de voz que descuelga un teléfono ejecuta la misma cadena. Entra el audio. Se transcribe. Un modelo razona sobre la transcripción. La respuesta se pronuncia de vuelta. Todo ello fluye en paralelo.
| Capa | Qué hace | Proveedores habituales |
|---|---|---|
| Telefonía | Enruta el audio entre el teléfono y el servidor | Twilio, Telnyx, Vonage, Avaya |
| Voz a texto (STT) | Convierte el audio en texto | Deepgram, AssemblyAI, Whisper |
| Modelo de lenguaje (LLM) | Lee, razona, decide, responde | GPT-5, GPT-4o, Claude 4.5, Gemini 3.0 |
| Texto a voz (TTS) | Convierte el texto en audio hablado | ElevenLabs, Cartesia, OpenAI, MiniMax |
| Orquestación | Transmite, almacena en búfer, gestiona los turnos y las llamadas a herramientas | La plataforma de IA de voz |
Las primeras cuatro son commodities. Todo el mundo usa más o menos los mismos proveedores. La quinta es donde los equipos queman en silencio de tres a seis meses de ingeniería cuando intentan construirla ellos mismos.
El coste oculto de «lo montamos nosotros mismos»: WebSockets de streaming. Búfer por límites de frase. Detección de actividad de voz. Recuperación de interrupciones. Llamadas a funciones a mitad de llamada. Lógica de reintentos entre cuatro API. Integración SIP que gestione las peculiaridades del códec de 8 kHz. Nada de esto viene de serie.
No. No con una plataforma. Con una plataforma de IA de voz, firmas un acuerdo y recibes una factura. Con infraestructura en bruto, firmas cuatro.
En las evaluaciones reales aparecen tres vías de compra:
1. Plataforma empaquetada: Un contrato, una factura, un panel. Eliges una voz y un LLM en menús desplegables; la plataforma gestiona las licencias, las llamadas a la API y la medición. Esto es lo que la mayoría de los equipos eligen durante los primeros 90 días.
2. Infraestructura en bruto: Twilio + un proveedor de STT + una API de LLM + un proveedor de TTS, unidos con tu propio código de orquestación. Máximo control, cuatro juegos de credenciales, de tres a seis meses de ingeniería antes de atender una llamada real.
3. Híbrido con componentes propios: La plataforma gestiona la orquestación y los componentes, pero tú aportas tu propio trunk SIP, tu modelo afinado o tus claves de voz. Aquí es donde acaban la mayoría de los despliegues en producción tras el primer trimestre.
La tarifa de titular de una plataforma cubre la orquestación. Los componentes se suman por encima, y son partidas transparentes, no cargos ocultos.
Así se desglosa una llamada típica de gama media en la página de precios:
| Componente | Tarifa típica | Notas |
|---|---|---|
| Orquestación base | ~$0,07/min | Fija |
| Voz (Cartesia) | ~$0,05–$0,07/min | ElevenLabs/OpenAI salen más caras |
| LLM | $0,003–$0,08/min | Gemini Flash el más barato, GPT-5 el más caro |
| Telefonía (integrada) | ~$0,015/min | O $0 con tu propio trunk SIP |
| Total (típico) | $0,13–$0,20/min | Voz de gama media + modelo competente |
Dos notas antes de que modeles esto para finanzas:
Sí, y sí. Depende de lo que ya tengas.
Puedes comprar un número de teléfono directamente dentro del panel y empezar a atender llamadas en menos de una hora. También puedes aportar un número existente de Twilio, Telnyx, Vonage o Avaya mediante SIP trunking y saltarte al operador revendido por completo. Ambas vías usan la misma capa de orquestación por debajo.
Regla de decisión rápida:
Puedes cambiar más adelante. Reimportar un número lleva minutos, no planes de migración.
No. La voz que eliges en un menú desplegable está incluida en el precio por minuto.
Esto hace tropezar a muchas llamadas de evaluación porque ElevenLabs vende dos productos distintos:
Si usas una plataforma de IA de voz, obtienes el n.º 2. Sin clave de API separada. Sin suscripción separada. Sin factura separada. Las licencias y la medición ocurren en el backend.
La misma lógica se aplica a Cartesia, OpenAI TTS, MiniMax y los propios modelos de voz de la plataforma. La única excepción es la clonación de voz empresarial, que se configura por separado para equipos que necesitan una voz específica de marca.
No. La inferencia viene incluida. Eliges el modelo en un menú desplegable y el precio por minuto se ajusta:
Sin clave de API de OpenAI por tu parte. Sin cuenta de Anthropic. Sin proyecto de Google Cloud.
Si quieres aportar tu propio modelo (pesos afinados, un contrato de OpenAI Enterprise que ya hayas firmado, o un despliegue autoalojado de Llama), la plataforma admite un LLM personalizado por WebSocket. Los pasos de integración están en la documentación.
¿Cuándo es un modelo propio la opción adecuada?
Para el resto, la vía empaquetada es más rápida de desplegar y más fácil de cambiar cuando llega un nuevo modelo.
Esta es la parte que pilla desprevenidos a los equipos. La plataforma gestiona la conversación. Tú gestionas el negocio al que sirve.
| Tú aportas | La plataforma gestiona |
|---|---|
| El contenido de la base de conocimiento (tu catálogo de servicios, precios, horarios, políticas) | La recuperación RAG y la sincronización automática |
| El CRM y el sistema de registro | Las llamadas a webhooks durante la conversación |
| El calendario y el sistema de reservas | Las comprobaciones de disponibilidad en tiempo real y la creación de eventos |
| El diseño del flujo de conversación | El framework de arrastrar y soltar para construirlo |
| Las reglas de escalado y enrutamiento | La transferencia asistida con contexto completo |
Algunas notas que merece la pena destacar:
La brecha de coste es pequeña. La brecha de tiempo es enorme.
| Plataforma empaquetada | Construcción con componentes propios | |
|---|---|---|
| Relaciones con proveedores | 1 | 4+ |
| Tiempo hasta la primera llamada en vivo | Menos de una hora | 3–6 meses |
| Coste cargado por minuto | $0,13–$0,20 | $0,13–$0,31 |
| Ingeniería requerida | Diseño de prompts + flujos | Pipeline de streaming + lógica de reintentos + observabilidad + gestión de SIP |
| Cadena de cumplimiento | Un único BAA | Uno por cada proveedor del stack |
Una construcción típica con componentes propios recurre a Twilio para la telefonía, Deepgram o AssemblyAI para la transcripción, GPT-5 o Claude 4.5 para el razonamiento, ElevenLabs o Cartesia para la voz, y Pipecat o LiveKit para la orquestación. El cálculo por minuto acaba más o menos en el mismo vecindario que una plataforma empaquetada.
Lo que pagas cuando construyes es tiempo de ingeniería. Detección de actividad de voz, gestión de interrupciones, llamadas a funciones que sobreviven a fallos a mitad de llamada, observabilidad que correlaciona cuatro paneles de proveedores en una sola traza, e integración SIP que gestione con elegancia las peculiaridades del códec de 8 kHz del audio de telefonía. Nada de esto viene de serie.
La mayoría de los modelos de transcripción modernos se entrenan principalmente con audio de 16 kHz. La telefonía te entrega 8 kHz. La brecha de precisión en un pipeline recién construido es real y perceptible para quien llama.
Esa brecha entre meses de fontanería y días de ingeniería de prompts es la razón por la que la mayoría de los agentes de voz en producción en 2026 se despliegan sobre una plataforma.
Twilio, ElevenLabs, OpenAI y Retell AI no compiten por el mismo dólar. Son capas apiladas en la misma arquitectura:
El marco correcto rara vez es «Retell o Twilio». Es «Retell sobre Twilio». Lo mismo con OpenAI y ElevenLabs. El único solapamiento real está en la capa de orquestación, y la página Retell vs ElevenLabs cubre esa comparación más acotada para equipos que eligen entre una plataforma y el propio producto de extremo a extremo de ElevenLabs.
El cumplimiento reside en la capa de plataforma. SOC 2 Type II, HIPAA con un BAA de autoservicio y GDPR vienen incluidos sin recargos de cumplimiento por minuto.
Donde esto importa más es en la construcción sin paquete. El cumplimiento no se detiene en la orquestación en un stack montado a mano. Cada proveedor de la cadena (STT, LLM, TTS, telefonía) tiene su propio proceso de BAA, sus propios términos de tratamiento de datos y su propia pista de auditoría. Los equipos de compras en sanidad, seguros y servicios financieros suelen elegir el paquete solo por esa razón.
La aprobación de un proveedor se mueve más rápido que la de cuatro.
Tres despliegues hacen el compromiso más concreto:
Anker: Automatización de voz en centros de soporte globales que gestionan millones de llamadas al año en Norteamérica, Europa y Asia. Los agentes alcanzan más del 95 % de precisión en el reconocimiento de voz en los mercados de habla inglesa, funcionando sobre la telefonía existente de Anker en lugar de un pipeline de cuatro proveedores.
Medical Data Systems: Operaciones de cobros a través de la plataforma. El equipo ahora gestiona el 100 % de las llamadas entrantes con solo una tasa de transferencia del 30 %, cobrando unos 280 000 dólares al mes. Esa tasa de transferencia del 30 % es una decisión de negocio, no un valor por defecto de la plataforma.
Matic Insurance: Bot de operador fuera de horario que gestiona soporte, confirmación de citas y admisión. En el primer trimestre, el bot gestionó unas 8000 llamadas, con tasas de respuesta que superaron la referencia liderada por humanos. El bot funciona sobre la relación existente de Matic con Twilio.
El patrón en los tres casos:
Esa es la línea entre empaquetar y aportar los componentes propios en despliegues reales de producción.
¿Necesito una suscripción de ElevenLabs para usar una plataforma de IA de voz?
No. Las voces vienen integradas en el precio por minuto. La excepción es la clonación de voz empresarial, que se configura por separado.
¿Es Twilio necesario para operar un agente de voz con IA?
No. La mayoría de las plataformas admiten Telnyx, Vonage, Avaya y cualquier operador compatible con SIP mediante trunking directo, además de sus propios números integrados. Twilio domina la conversación solo porque es el operador existente más común.
¿Puedo aportar mi propio LLM?
Sí. Los LLM personalizados se admiten mediante una integración por WebSocket, incluidos los contratos de OpenAI Enterprise, la API de Anthropic, Gemini y modelos autoalojados. Pagas a tu proveedor de modelo por la inferencia y a la plataforma por la orquestación.
¿Cómo se compara el precio empaquetado con una construcción DIY sobre Twilio + OpenAI + ElevenLabs?
Los costes totales cargados acaban más o menos en el mismo rango: entre $0,13 y $0,31 por minuto. La economía por minuto no es el factor decisivo. El factor decisivo es el tiempo de ingeniería ahorrado en la capa de orquestación, que suele ser de meses.
¿Qué incluye la capa de orquestación?
Transmisión de audio en fragmentos, búfer por límites de frase entre el modelo de lenguaje y el TTS, gestión de turnos e interrupciones, llamadas a funciones durante una llamada en vivo, reintentos y failover entre las API subyacentes, pruebas de simulación, transcripciones con puntuación de sentimiento y un panel de observabilidad unificado.
¿Puedo usar una plataforma de IA de voz para llamadas salientes a escala?
Sí. Las llamadas por lotes admiten campañas salientes con 20 llamadas simultáneas gratis en cada cuenta. Los casos de uso comunes incluyen telemarketing con IA, cualificación de leads, seguimiento de gestión de cobros y recordatorios de citas. El cumplimiento de TCPA y STIR/SHAKEN se configura a nivel de operador.
¿Qué pasa cuando el agente no puede gestionar una llamada?
Transferencia asistida con contexto completo de la conversación. La persona que la recibe ve la transcripción y los datos estructurados que recopiló el agente, de modo que quien llama no tiene que repetirse. Los umbrales de escalado (intentos fallidos de aclaración, temas sensibles, peticiones explícitas de quien llama) se configuran por agente.
¿Es la plataforma apta para sectores regulados?
Sí. SOC 2 Type II, HIPAA con un BAA de autoservicio, GDPR y la redacción de PII vienen incluidos. El despliegue on-premise está disponible para equipos con requisitos estrictos de residencia de datos.
¿Cuánto se tarda desde el registro hasta un agente en vivo?
La mayoría de los equipos tienen una llamada de prueba funcionando en una hora y un agente listo para producción en 1–2 semanas. La plataforma procesa más de 50 millones de llamadas al mes en más de 3000 empresas, así que la vía de despliegue está muy trillada.
Las cuatro piezas en tiempo real (telefonía, transcripción, modelo de lenguaje, síntesis de voz) se están convirtiendo en commodities a toda velocidad. Cualquiera puede comprarlas. La orquestación que las convierte en una llamada telefónica que dejarías oír a un cliente es donde se compone la ingeniería, y es por lo que una cuota de plataforma por minuto merece la pena en 2026.
La forma más rápida de percibir dónde está la línea es hacer una llamada real. El registro de Retell AI incluye $10 en créditos de uso, suficiente para desplegar un agente de prueba contra tu propio número y ver dónde encajan tus sistemas existentes frente a lo que la plataforma gestiona de extremo a extremo.
A partir de ahí, el siguiente paso natural es el flujo de trabajo que más te importe:
Construye con los $10 en créditos en retellai.com.
Descubre cuánto podría ahorrar tu empresa al pasar a agentes de voz impulsados por IA.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Un número de teléfono de demostración de Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)