Cosa include una piattaforma di IA vocale? Telefonia, TTS, STT, LLM e cosa devi ancora portare

Cosa include una piattaforma di IA vocale? Telefonia, TTS, STT, LLM e cosa devi ancora portare
BACK TO BLOGS
ON THIS PAGE
Back to top

La maggior parte delle piattaforme di IA vocale combina quattro elementi in un unico prezzo al minuto: speech-to-text, il modello linguistico, text-to-speech e l'orchestrazione che li unisce in una telefonata in tempo reale. La telefonia entra tramite SIP, ma i minuti dell'operatore, i sistemi con cui il tuo agente comunica e la logica di conversazione stessa restano tuoi.

Questa Γ¨ la risposta completa. Il resto di questa guida Γ¨ per gli acquirenti che rimangono bloccati sempre sulla stessa domanda di valutazione: "Aspetta, servono abbonamenti separati per telefonia, TTS, STT e LLM, oppure sono giΓ  parte della piattaforma?"

Se ti sei trovato in una chiamata con un fornitore a confrontare una piattaforma di IA vocale fianco a fianco con Twilio, ElevenLabs o OpenAI chiedendoti quale fosse piΓΉ economica, questo articolo Γ¨ la risposta piΓΉ chiara che troverai. Quei fornitori non stanno nella stessa colonna. Ognuno vende un singolo strato dello stack. Una piattaforma come Retell AI vende l'insieme orchestrato.

Sapere quale strato stai acquistando con il tuo denaro risponde a quattro domande pratiche:

  • Quali contratti firmi
  • Quali fatture ricevi ogni mese
  • Quante ore di ingegneria spendi prima di andare in produzione
  • Quali parti dello stack puoi sostituire quando cambiano prezzi o modelli

Lo stack dell'IA vocale in sintesi

Ogni agente vocale che risponde al telefono esegue la stessa catena. L'audio entra. Viene trascritto. Un modello ragiona sulla trascrizione. La risposta viene pronunciata. Tutto scorre in parallelo.

StratoCosa faFornitori comuni
TelefoniaInstrada l'audio tra telefono e serverTwilio, Telnyx, Vonage, Avaya
Speech-to-text (STT)Trasforma l'audio in testoDeepgram, AssemblyAI, Whisper
Modello linguistico (LLM)Legge, ragiona, decide, rispondeGPT-5, GPT-4o, Claude 4.5, Gemini 3.0
Text-to-speech (TTS)Trasforma il testo in audio parlatoElevenLabs, Cartesia, OpenAI, MiniMax
OrchestrazioneTrasmette, bufferizza, gestisce l'alternanza dei turni e le chiamate agli strumentiLa piattaforma di IA vocale

I primi quattro sono commodity. Tutti usano piΓΉ o meno gli stessi fornitori. Il quinto Γ¨ dove i team bruciano silenziosamente dai tre ai sei mesi di ingegneria quando provano a costruirlo da soli.

Il costo nascosto del "lo assembliamo da soli": WebSocket in streaming. Buffering ai confini di frase. Rilevamento dell'attivitΓ  vocale. Recupero dopo un'interruzione (barge-in). Chiamata di funzioni durante la chiamata. Logica di retry su quattro API. Integrazione SIP che gestisce le peculiaritΓ  del codec a 8 kHz. Nulla di tutto ciΓ² Γ¨ pronto all'uso.

Servono abbonamenti separati per telefonia, TTS, STT e LLM?

No. Non con una piattaforma. Con una piattaforma di IA vocale, firmi un solo accordo e ricevi una sola fattura. Con l'infrastruttura grezza, ne firmi quattro.

Nelle valutazioni reali emergono tre percorsi d'acquisto:

1. Piattaforma integrata: Un contratto, una fattura, una dashboard. Scegli una voce e un LLM da menu a tendina; la piattaforma gestisce licenze, chiamate API e misurazione. Questo Γ¨ ciΓ² che sceglie la maggior parte dei team per i primi 90 giorni.

2. Infrastruttura grezza: Twilio + un fornitore STT + un'API LLM + un fornitore TTS, uniti insieme con il tuo codice di orchestrazione. Massimo controllo, quattro set di credenziali, dai tre ai sei mesi di ingegneria prima di gestire una chiamata reale.

3. Ibrido bring-your-own: La piattaforma gestisce l'orchestrazione e i componenti, ma tu porti il tuo trunk SIP, il modello ottimizzato o le chiavi vocali. Qui finiscono la maggior parte dei deployment in produzione dopo il primo trimestre.

Cosa include il prezzo al minuto?

La tariffa di punta di una piattaforma copre l'orchestrazione. I componenti si aggiungono sopra, e sono voci trasparenti, non costi nascosti.

Ecco come si scompone una tipica chiamata mid-market sulla pagina prezzi:

ComponenteTariffa tipicaNote
Orchestrazione di base~$0.07/minFissa
Voce (Cartesia)~$0.05–$0.07/minElevenLabs/OpenAI costano di piΓΉ
LLM$0.003–$0.08/minGemini Flash il piΓΉ economico, GPT-5 il piΓΉ alto
Telefonia (integrata)~$0.015/minOppure $0 con il tuo trunk SIP
Tutto incluso (tipico)$0.13–$0.20/minVoce di fascia media + modello competente

Due note prima di modellare tutto ciΓ² per il reparto finanziario:

  • Un punto d'ingresso da $0.07 non Γ¨ un costo di produzione da $0.07. La tariffa di punta copre solo l'orchestrazione.
  • Gli add-on stanno al di fuori della tariffa al minuto: knowledge base in streaming (gratis per i primi dieci, poi ~$0.005/min), concorrenza oltre le 20 chiamate, ID chiamante con brand. Nessuno Γ¨ necessario per andare in produzione.

La telefonia Γ¨ inclusa, oppure serve ancora Twilio?

Sì, ed è così. Dipende da cosa hai già.

Puoi acquistare un numero di telefono direttamente nella dashboard e iniziare a gestire chiamate in meno di un'ora. Puoi anche portare un numero Twilio, Telnyx, Vonage o Avaya esistente tramite trunking SIP e saltare del tutto l'operatore rivenduto. Entrambi i percorsi usano lo stesso strato di orchestrazione sottostante.

Regola decisionale rapida:

  • Parti da zero? Usa il numero integrato. PiΓΉ veloce, piΓΉ economico, nessuna configurazione dell'operatore.
  • Contratto con operatore esistente o numeri portati? Porta il tuo trunk SIP. Mantieni le tue tariffe, la tua attestazione STIR/SHAKEN e il tuo portafoglio DID.
  • Sei giΓ  profondamente immerso in un'integrazione Twilio? Stessa risposta: punta il trunk verso la piattaforma e importa il numero.

Puoi cambiare in seguito. Reimportare un numero richiede minuti, non piani di migrazione.

Devo pagare ElevenLabs separatamente?

No. La voce che scegli da un menu a tendina Γ¨ inclusa nel prezzo al minuto.

Questo confonde molte chiamate di valutazione perchΓ© ElevenLabs vende due prodotti distinti:

  • Il proprio prodotto Conversational AI end-to-end (venduto direttamente, ~$0.10/min piΓΉ i costi LLM)
  • I suoi modelli vocali, concessi in licenza a piattaforme che li incorporano e li rivendono su base al minuto

Se usi una piattaforma di IA vocale, ottieni il #2. Nessuna chiave API separata. Nessun abbonamento separato. Nessuna fattura separata. Le licenze e la misurazione avvengono nel backend.

La stessa logica vale per Cartesia, OpenAI TTS, MiniMax e i modelli vocali della piattaforma stessa. L'unica eccezione Γ¨ la clonazione vocale enterprise, che viene configurata separatamente per i team che necessitano di una voce specifica per il brand.

Serve un abbonamento OpenAI per l'LLM?

No. L'inferenza Γ¨ inclusa. Scegli il modello da un menu a tendina e il prezzo al minuto si adegua:

  • PiΓΉ economici: Gemini 3.0 Flash, GPT-5 Nano (frazioni di centesimo)
  • Fascia media: GPT-4o, Claude Haiku
  • Ragionamento intensivo: Claude 4.5 Sonnet, GPT-5

Nessuna chiave API OpenAI da parte tua. Nessun account Anthropic. Nessun progetto Google Cloud.

Se vuoi portare il tuo modello (pesi ottimizzati, un contratto OpenAI Enterprise che hai giΓ  firmato o un deployment Llama self-hosted), la piattaforma supporta un WebSocket per LLM personalizzato. I passaggi di integrazione sono nella documentazione.

Quando bring-your-own-model diventa la scelta giusta?

  • Requisiti rigorosi di residenza dei dati
  • Impegni LLM esistenti che vuoi monetizzare
  • Fine-tuning specifico per dominio che batte materialmente i modelli generici nel tuo caso d'uso

Per tutti gli altri, il percorso integrato Γ¨ piΓΉ veloce da distribuire e piΓΉ facile da sostituire quando arriva un nuovo modello.

Cosa devi ancora portare

Ecco la parte che coglie i team di sorpresa. La piattaforma gestisce la conversazione. Tu gestisci il business che serve.

Tu portiLa piattaforma gestisce
Il contenuto della knowledge base (il tuo catalogo servizi, prezzi, orari, policy)Recupero RAG e auto-sincronizzazione
CRM e sistema di registrazioneChiamate webhook durante la conversazione
Calendario e sistema di prenotazioneControlli di disponibilitΓ  in tempo reale e creazione di eventi
Progettazione del flusso di conversazioneIl framework drag-and-drop per costruirlo
Regole di escalation e instradamentoIl trasferimento assistito con contesto completo

Alcune note che vale la pena evidenziare:

  • La knowledge base si auto-sincronizza dal tuo sito web o dal set di documenti, ma il contenuto di quei documenti sta a te tenerlo aggiornato. Spazzatura in ingresso, spazzatura in uscita, come in qualsiasi sistema RAG.
  • L'integrazione CRM funziona tramite webhook, Make, n8n, Zapier o un'integrazione nativa HubSpot. L'agente puΓ² leggere e scrivere su Salesforce o HubSpot durante una chiamata dal vivo, ma lo schema e i permessi restano tuoi.
  • Per i flussi di fissare appuntamenti, l'integrazione funziona con Cal.com, Google Calendar, Calendly o qualsiasi sistema di prenotazione contenga il tuo calendario di riferimento.
  • Esistono template per pattern comuni come agente per la fissazione di appuntamenti con IA, servizio di segreteria con IA, assistenza inbound, ma le domande effettive che il tuo agente pone e cosa conta come "lead qualificato" sono decisioni che solo tu puoi prendere.
  • Per le escalation di trasferimento di chiamata, definisci tu la soglia. I deployment in produzione automatizzano regolarmente fino all' 80 percento delle chiamate inbound, ma dove tracci il confine tra IA e umano dipende da te.

Integrare vs. costruire: il confronto onesto

Il divario di costo Γ¨ piccolo. Il divario di tempo Γ¨ enorme.

Piattaforma integrataBuild bring-your-own
Relazioni con i fornitori14+
Tempo alla prima chiamata dal vivoMeno di un'ora3–6 mesi
Costo al minuto completo$0.13–$0.20$0.13–$0.31
Ingegneria necessariaProgettazione di prompt + flussoPipeline in streaming + logica di retry + osservabilitΓ  + gestione SIP
Catena di conformitΓ Un singolo BAAUno per ogni fornitore nello stack

Un tipico build bring-your-own usa Twilio per la telefonia, Deepgram o AssemblyAI per la trascrizione, GPT-5 o Claude 4.5 per il ragionamento, ElevenLabs o Cartesia per la voce e Pipecat o LiveKit per l'orchestrazione. Il calcolo al minuto atterra piΓΉ o meno nello stesso ambito di una piattaforma integrata.

CiΓ² che paghi quando costruisci Γ¨ il tempo di ingegneria. Rilevamento dell'attivitΓ  vocale, gestione del barge-in, chiamata di funzioni che sopravvive ai guasti durante la chiamata, osservabilitΓ  che correla quattro dashboard di fornitori in un'unica traccia e integrazione SIP che gestisce con eleganza le peculiaritΓ  del codec a 8 kHz dell'audio telefonico. Nulla di tutto ciΓ² Γ¨ pronto all'uso.

La maggior parte dei modelli di trascrizione moderni Γ¨ addestrata principalmente su audio a 16 kHz. La telefonia ti fornisce audio a 8 kHz. Il divario di accuratezza su una pipeline costruita da zero Γ¨ reale e percepibile dai chiamanti.

Quel divario tra mesi di plumbing e giorni di prompt engineering Γ¨ il motivo per cui la maggior parte degli agenti vocali in produzione nel 2026 va in produzione su una piattaforma.

Dove si collocano i confini

Twilio, ElevenLabs, OpenAI e Retell AI non competono per lo stesso dollaro. Sono strati impilati nella stessa architettura:

  • Twilio, Telnyx, Vonage β†’ telefonia. Spostano l'audio tra telefoni e server.
  • ElevenLabs, Cartesia, OpenAI TTS, MiniMax β†’ sintesi vocale. Trasformano il testo in parlato.
  • OpenAI, Anthropic, Google β†’ inferenza del modello linguistico. Il cervello che ragiona.
  • Retell AI β†’ orchestrazione piΓΉ il framework dell'agente, analisi post-chiamata, chiamate in batch, test di simulazione e l'involucro commerciale che trasforma quattro fatture in una.

L'inquadramento corretto è raramente "Retell o Twilio." È "Retell sopra Twilio." Lo stesso con OpenAI ed ElevenLabs. L'unica vera sovrapposizione si trova nello strato di orchestrazione, e la pagina Retell vs ElevenLabs copre quel confronto più ristretto per i team che scelgono tra una piattaforma e il prodotto end-to-end di ElevenLabs.

E per quanto riguarda HIPAA, SOC 2 e GDPR?

La conformitΓ  risiede nello strato della piattaforma. SOC 2 Type II, HIPAA con un BAA self-service e GDPR sono inclusi senza sovrapprezzi di conformitΓ  al minuto.

Dove questo conta di piΓΉ Γ¨ il build disaggregato. La conformitΓ  non si ferma all'orchestrazione in uno stack assemblato insieme. Ogni fornitore nella catena (STT, LLM, TTS, telefonia) ha il proprio processo BAA, i propri termini di gestione dei dati e la propria traccia di audit. I team di approvvigionamento nel settore sanitario, assicurativo e dei servizi finanziari di solito scelgono il pacchetto solo per questo motivo.

L'approvazione di un fornitore va piΓΉ veloce di quattro.

Come si comporta il pacchetto in produzione

Tre deployment rendono concreto il compromesso:

Anker: Automazione vocale nei centri di assistenza globali che gestiscono milioni di chiamate all'anno in Nord America, Europa e Asia. Gli agenti raggiungono un'accuratezza di riconoscimento vocale superiore al 95% nei mercati anglofoni, funzionando sopra la telefonia esistente di Anker anzichΓ© su una pipeline a quattro fornitori.

Medical Data Systems: Operazioni di recupero crediti tramite la piattaforma. Il team ora gestisce il 100% delle chiamate inbound con un tasso di trasferimento di solo il 30%, incassando circa $280.000 al mese. Quel tasso di trasferimento del 30% Γ¨ una decisione di business, non un'impostazione predefinita della piattaforma.

Matic Insurance: Bot operatore fuori orario che gestisce assistenza, conferma appuntamenti e intake. Nel Q1, il bot ha gestito circa 8.000 chiamate, con tassi di risposta che hanno battuto la baseline gestita da umani. Il bot si appoggia sulla relazione Twilio esistente di Matic.

Il pattern in tutti e tre i casi:

  • La piattaforma possiede lo strato dell'agente
  • I sistemi esistenti del cliente possiedono i dati e i flussi di lavoro
  • La relazione con l'operatore Γ¨ un contratto separato

Questa Γ¨ la linea tra pacchetto e bring-your-own nei deployment reali in produzione.

Domande frequenti

Serve un abbonamento ElevenLabs per usare una piattaforma di IA vocale?

No. Le voci sono incorporate nel prezzo al minuto. L'eccezione Γ¨ la clonazione vocale enterprise, che viene configurata separatamente.

Twilio Γ¨ necessario per eseguire un agente di IA vocale?

No. La maggior parte delle piattaforme supporta Telnyx, Vonage, Avaya e qualsiasi operatore compatibile con SIP tramite trunking diretto, oltre ai propri numeri integrati. Twilio domina la conversazione solo perchΓ© Γ¨ l'operatore esistente piΓΉ comune.

Posso portare il mio LLM?

Sì. Gli LLM personalizzati sono supportati tramite un'integrazione WebSocket, inclusi i contratti OpenAI Enterprise, l'API Anthropic, Gemini e i modelli self-hosted. Paghi il tuo fornitore di modelli per l'inferenza e la piattaforma per l'orchestrazione.

Come si confronta il prezzo integrato con un build DIY su Twilio + OpenAI + ElevenLabs?

I costi completi tutto incluso atterrano piΓΉ o meno nello stesso intervallo: tra $0.13 e $0.31 al minuto. L'economia al minuto non Γ¨ il fattore decisivo. Il fattore decisivo Γ¨ il tempo di ingegneria risparmiato sullo strato di orchestrazione, che Γ¨ tipicamente di mesi.

Cosa include lo strato di orchestrazione?

Streaming dell'audio in blocchi, buffering ai confini di frase tra il modello linguistico e il TTS, alternanza dei turni e barge-in, chiamata di funzioni durante una chiamata dal vivo, retry e failover sulle API sottostanti, test di simulazione, trascrizioni con analisi del sentiment e una dashboard di osservabilitΓ  unificata.

Posso usare una piattaforma di IA vocale per chiamate in uscita su larga scala?

Sì. Le chiamate in batch supportano campagne in uscita con 20 chiamate concorrenti gratuite su ogni account. I casi d'uso comuni includono telemarketing con IA, qualificazione dei lead, follow-up di recupero crediti e promemoria di appuntamenti. La conformità TCPA e STIR/SHAKEN è configurata a livello di operatore.

Cosa succede quando l'agente non riesce a gestire una chiamata?

Trasferimento assistito con contesto completo della conversazione. L'umano che risponde vede la trascrizione e i dati strutturati raccolti dall'agente, così il chiamante non deve ripetersi. Le soglie di escalation (tentativi di chiarimento falliti, argomenti sensibili, richieste esplicite del chiamante) sono configurate per ogni agente.

La piattaforma Γ¨ adatta a settori regolamentati?

Sì. SOC 2 Type II, HIPAA con un BAA self-service, GDPR e redazione delle PII sono inclusi. Il deployment on-premise è disponibile per i team con requisiti rigorosi di residenza dei dati.

Quanto tempo ci vuole per passare dalla registrazione a un agente dal vivo?

La maggior parte dei team ha una chiamata di test funzionante entro un'ora e un agente pronto per la produzione entro 1–2 settimane. La piattaforma elabora oltre 50 milioni di chiamate al mese in oltre 3.000 aziende, quindi il percorso di deployment Γ¨ ben collaudato.

La decisione d'acquisto in un paragrafo

I quattro elementi in tempo reale (telefonia, trascrizione, modello linguistico, sintesi vocale) si stanno rapidamente trasformando in commodity. Chiunque puΓ² acquistarli. L'orchestrazione che li trasforma in una telefonata che faresti ascoltare a un cliente Γ¨ dove l'ingegneria si accumula, ed Γ¨ il motivo per cui vale la pena pagare una tariffa di piattaforma al minuto nel 2026.

Il modo piΓΉ veloce per capire dove si trova la linea Γ¨ fare una chiamata reale. La registrazione a Retell AI include $10 di crediti di utilizzo, sufficienti per distribuire un agente di test contro il tuo numero e vedere dove si inseriscono i tuoi sistemi esistenti rispetto a ciΓ² che la piattaforma gestisce end-to-end.

Da lì, il passo successivo naturale è qualunque flusso di lavoro conti di più:

  • Assistenza clienti con IA per la deviazione delle chiamate inbound
  • Una sostituzione IVR con IA per il menu telefonico che i tuoi chiamanti giΓ  detestano
  • Una campagna in uscita per i lead presenti nel tuo CRM

Costruisci con i $10 di crediti su retellai.com.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done!Β 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
Β Β Β 1
Β Β Β 8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Demo dal vivo
Prova la nostra demo dal vivo

Un numero di telefono demo di Retell Clinic Office

Grazie! Il tuo modulo Γ¨ stato ricevuto!
Ops! Qualcosa Γ¨ andato storto durante l'invio del modulo.

Read Other Blogs

Revolutionize your call operation with Retell