La maggior parte delle piattaforme di IA vocale combina quattro elementi in un unico prezzo al minuto: speech-to-text, il modello linguistico, text-to-speech e l'orchestrazione che li unisce in una telefonata in tempo reale. La telefonia entra tramite SIP, ma i minuti dell'operatore, i sistemi con cui il tuo agente comunica e la logica di conversazione stessa restano tuoi.
Questa Γ¨ la risposta completa. Il resto di questa guida Γ¨ per gli acquirenti che rimangono bloccati sempre sulla stessa domanda di valutazione: "Aspetta, servono abbonamenti separati per telefonia, TTS, STT e LLM, oppure sono giΓ parte della piattaforma?"
Se ti sei trovato in una chiamata con un fornitore a confrontare una piattaforma di IA vocale fianco a fianco con Twilio, ElevenLabs o OpenAI chiedendoti quale fosse piΓΉ economica, questo articolo Γ¨ la risposta piΓΉ chiara che troverai. Quei fornitori non stanno nella stessa colonna. Ognuno vende un singolo strato dello stack. Una piattaforma come Retell AI vende l'insieme orchestrato.
Sapere quale strato stai acquistando con il tuo denaro risponde a quattro domande pratiche:
Ogni agente vocale che risponde al telefono esegue la stessa catena. L'audio entra. Viene trascritto. Un modello ragiona sulla trascrizione. La risposta viene pronunciata. Tutto scorre in parallelo.
| Strato | Cosa fa | Fornitori comuni |
|---|---|---|
| Telefonia | Instrada l'audio tra telefono e server | Twilio, Telnyx, Vonage, Avaya |
| Speech-to-text (STT) | Trasforma l'audio in testo | Deepgram, AssemblyAI, Whisper |
| Modello linguistico (LLM) | Legge, ragiona, decide, risponde | GPT-5, GPT-4o, Claude 4.5, Gemini 3.0 |
| Text-to-speech (TTS) | Trasforma il testo in audio parlato | ElevenLabs, Cartesia, OpenAI, MiniMax |
| Orchestrazione | Trasmette, bufferizza, gestisce l'alternanza dei turni e le chiamate agli strumenti | La piattaforma di IA vocale |
I primi quattro sono commodity. Tutti usano piΓΉ o meno gli stessi fornitori. Il quinto Γ¨ dove i team bruciano silenziosamente dai tre ai sei mesi di ingegneria quando provano a costruirlo da soli.
Il costo nascosto del "lo assembliamo da soli": WebSocket in streaming. Buffering ai confini di frase. Rilevamento dell'attivitΓ vocale. Recupero dopo un'interruzione (barge-in). Chiamata di funzioni durante la chiamata. Logica di retry su quattro API. Integrazione SIP che gestisce le peculiaritΓ del codec a 8 kHz. Nulla di tutto ciΓ² Γ¨ pronto all'uso.
No. Non con una piattaforma. Con una piattaforma di IA vocale, firmi un solo accordo e ricevi una sola fattura. Con l'infrastruttura grezza, ne firmi quattro.
Nelle valutazioni reali emergono tre percorsi d'acquisto:
1. Piattaforma integrata: Un contratto, una fattura, una dashboard. Scegli una voce e un LLM da menu a tendina; la piattaforma gestisce licenze, chiamate API e misurazione. Questo Γ¨ ciΓ² che sceglie la maggior parte dei team per i primi 90 giorni.
2. Infrastruttura grezza: Twilio + un fornitore STT + un'API LLM + un fornitore TTS, uniti insieme con il tuo codice di orchestrazione. Massimo controllo, quattro set di credenziali, dai tre ai sei mesi di ingegneria prima di gestire una chiamata reale.
3. Ibrido bring-your-own: La piattaforma gestisce l'orchestrazione e i componenti, ma tu porti il tuo trunk SIP, il modello ottimizzato o le chiavi vocali. Qui finiscono la maggior parte dei deployment in produzione dopo il primo trimestre.
La tariffa di punta di una piattaforma copre l'orchestrazione. I componenti si aggiungono sopra, e sono voci trasparenti, non costi nascosti.
Ecco come si scompone una tipica chiamata mid-market sulla pagina prezzi:
| Componente | Tariffa tipica | Note |
|---|---|---|
| Orchestrazione di base | ~$0.07/min | Fissa |
| Voce (Cartesia) | ~$0.05β$0.07/min | ElevenLabs/OpenAI costano di piΓΉ |
| LLM | $0.003β$0.08/min | Gemini Flash il piΓΉ economico, GPT-5 il piΓΉ alto |
| Telefonia (integrata) | ~$0.015/min | Oppure $0 con il tuo trunk SIP |
| Tutto incluso (tipico) | $0.13β$0.20/min | Voce di fascia media + modello competente |
Due note prima di modellare tutto ciΓ² per il reparto finanziario:
Sì, ed è così. Dipende da cosa hai già .
Puoi acquistare un numero di telefono direttamente nella dashboard e iniziare a gestire chiamate in meno di un'ora. Puoi anche portare un numero Twilio, Telnyx, Vonage o Avaya esistente tramite trunking SIP e saltare del tutto l'operatore rivenduto. Entrambi i percorsi usano lo stesso strato di orchestrazione sottostante.
Regola decisionale rapida:
Puoi cambiare in seguito. Reimportare un numero richiede minuti, non piani di migrazione.
No. La voce che scegli da un menu a tendina Γ¨ inclusa nel prezzo al minuto.
Questo confonde molte chiamate di valutazione perchΓ© ElevenLabs vende due prodotti distinti:
Se usi una piattaforma di IA vocale, ottieni il #2. Nessuna chiave API separata. Nessun abbonamento separato. Nessuna fattura separata. Le licenze e la misurazione avvengono nel backend.
La stessa logica vale per Cartesia, OpenAI TTS, MiniMax e i modelli vocali della piattaforma stessa. L'unica eccezione Γ¨ la clonazione vocale enterprise, che viene configurata separatamente per i team che necessitano di una voce specifica per il brand.
No. L'inferenza Γ¨ inclusa. Scegli il modello da un menu a tendina e il prezzo al minuto si adegua:
Nessuna chiave API OpenAI da parte tua. Nessun account Anthropic. Nessun progetto Google Cloud.
Se vuoi portare il tuo modello (pesi ottimizzati, un contratto OpenAI Enterprise che hai giΓ firmato o un deployment Llama self-hosted), la piattaforma supporta un WebSocket per LLM personalizzato. I passaggi di integrazione sono nella documentazione.
Quando bring-your-own-model diventa la scelta giusta?
Per tutti gli altri, il percorso integrato Γ¨ piΓΉ veloce da distribuire e piΓΉ facile da sostituire quando arriva un nuovo modello.
Ecco la parte che coglie i team di sorpresa. La piattaforma gestisce la conversazione. Tu gestisci il business che serve.
| Tu porti | La piattaforma gestisce |
|---|---|
| Il contenuto della knowledge base (il tuo catalogo servizi, prezzi, orari, policy) | Recupero RAG e auto-sincronizzazione |
| CRM e sistema di registrazione | Chiamate webhook durante la conversazione |
| Calendario e sistema di prenotazione | Controlli di disponibilitΓ in tempo reale e creazione di eventi |
| Progettazione del flusso di conversazione | Il framework drag-and-drop per costruirlo |
| Regole di escalation e instradamento | Il trasferimento assistito con contesto completo |
Alcune note che vale la pena evidenziare:
Il divario di costo Γ¨ piccolo. Il divario di tempo Γ¨ enorme.
| Piattaforma integrata | Build bring-your-own | |
|---|---|---|
| Relazioni con i fornitori | 1 | 4+ |
| Tempo alla prima chiamata dal vivo | Meno di un'ora | 3β6 mesi |
| Costo al minuto completo | $0.13β$0.20 | $0.13β$0.31 |
| Ingegneria necessaria | Progettazione di prompt + flusso | Pipeline in streaming + logica di retry + osservabilitΓ + gestione SIP |
| Catena di conformitΓ | Un singolo BAA | Uno per ogni fornitore nello stack |
Un tipico build bring-your-own usa Twilio per la telefonia, Deepgram o AssemblyAI per la trascrizione, GPT-5 o Claude 4.5 per il ragionamento, ElevenLabs o Cartesia per la voce e Pipecat o LiveKit per l'orchestrazione. Il calcolo al minuto atterra piΓΉ o meno nello stesso ambito di una piattaforma integrata.
CiΓ² che paghi quando costruisci Γ¨ il tempo di ingegneria. Rilevamento dell'attivitΓ vocale, gestione del barge-in, chiamata di funzioni che sopravvive ai guasti durante la chiamata, osservabilitΓ che correla quattro dashboard di fornitori in un'unica traccia e integrazione SIP che gestisce con eleganza le peculiaritΓ del codec a 8 kHz dell'audio telefonico. Nulla di tutto ciΓ² Γ¨ pronto all'uso.
La maggior parte dei modelli di trascrizione moderni Γ¨ addestrata principalmente su audio a 16 kHz. La telefonia ti fornisce audio a 8 kHz. Il divario di accuratezza su una pipeline costruita da zero Γ¨ reale e percepibile dai chiamanti.
Quel divario tra mesi di plumbing e giorni di prompt engineering Γ¨ il motivo per cui la maggior parte degli agenti vocali in produzione nel 2026 va in produzione su una piattaforma.
Twilio, ElevenLabs, OpenAI e Retell AI non competono per lo stesso dollaro. Sono strati impilati nella stessa architettura:
L'inquadramento corretto Γ¨ raramente "Retell o Twilio." Γ "Retell sopra Twilio." Lo stesso con OpenAI ed ElevenLabs. L'unica vera sovrapposizione si trova nello strato di orchestrazione, e la pagina Retell vs ElevenLabs copre quel confronto piΓΉ ristretto per i team che scelgono tra una piattaforma e il prodotto end-to-end di ElevenLabs.
La conformitΓ risiede nello strato della piattaforma. SOC 2 Type II, HIPAA con un BAA self-service e GDPR sono inclusi senza sovrapprezzi di conformitΓ al minuto.
Dove questo conta di piΓΉ Γ¨ il build disaggregato. La conformitΓ non si ferma all'orchestrazione in uno stack assemblato insieme. Ogni fornitore nella catena (STT, LLM, TTS, telefonia) ha il proprio processo BAA, i propri termini di gestione dei dati e la propria traccia di audit. I team di approvvigionamento nel settore sanitario, assicurativo e dei servizi finanziari di solito scelgono il pacchetto solo per questo motivo.
L'approvazione di un fornitore va piΓΉ veloce di quattro.
Tre deployment rendono concreto il compromesso:
Anker: Automazione vocale nei centri di assistenza globali che gestiscono milioni di chiamate all'anno in Nord America, Europa e Asia. Gli agenti raggiungono un'accuratezza di riconoscimento vocale superiore al 95% nei mercati anglofoni, funzionando sopra la telefonia esistente di Anker anzichΓ© su una pipeline a quattro fornitori.
Medical Data Systems: Operazioni di recupero crediti tramite la piattaforma. Il team ora gestisce il 100% delle chiamate inbound con un tasso di trasferimento di solo il 30%, incassando circa $280.000 al mese. Quel tasso di trasferimento del 30% Γ¨ una decisione di business, non un'impostazione predefinita della piattaforma.
Matic Insurance: Bot operatore fuori orario che gestisce assistenza, conferma appuntamenti e intake. Nel Q1, il bot ha gestito circa 8.000 chiamate, con tassi di risposta che hanno battuto la baseline gestita da umani. Il bot si appoggia sulla relazione Twilio esistente di Matic.
Il pattern in tutti e tre i casi:
Questa Γ¨ la linea tra pacchetto e bring-your-own nei deployment reali in produzione.
Serve un abbonamento ElevenLabs per usare una piattaforma di IA vocale?
No. Le voci sono incorporate nel prezzo al minuto. L'eccezione Γ¨ la clonazione vocale enterprise, che viene configurata separatamente.
Twilio Γ¨ necessario per eseguire un agente di IA vocale?
No. La maggior parte delle piattaforme supporta Telnyx, Vonage, Avaya e qualsiasi operatore compatibile con SIP tramite trunking diretto, oltre ai propri numeri integrati. Twilio domina la conversazione solo perchΓ© Γ¨ l'operatore esistente piΓΉ comune.
Posso portare il mio LLM?
Sì. Gli LLM personalizzati sono supportati tramite un'integrazione WebSocket, inclusi i contratti OpenAI Enterprise, l'API Anthropic, Gemini e i modelli self-hosted. Paghi il tuo fornitore di modelli per l'inferenza e la piattaforma per l'orchestrazione.
Come si confronta il prezzo integrato con un build DIY su Twilio + OpenAI + ElevenLabs?
I costi completi tutto incluso atterrano piΓΉ o meno nello stesso intervallo: tra $0.13 e $0.31 al minuto. L'economia al minuto non Γ¨ il fattore decisivo. Il fattore decisivo Γ¨ il tempo di ingegneria risparmiato sullo strato di orchestrazione, che Γ¨ tipicamente di mesi.
Cosa include lo strato di orchestrazione?
Streaming dell'audio in blocchi, buffering ai confini di frase tra il modello linguistico e il TTS, alternanza dei turni e barge-in, chiamata di funzioni durante una chiamata dal vivo, retry e failover sulle API sottostanti, test di simulazione, trascrizioni con analisi del sentiment e una dashboard di osservabilitΓ unificata.
Posso usare una piattaforma di IA vocale per chiamate in uscita su larga scala?
Sì. Le chiamate in batch supportano campagne in uscita con 20 chiamate concorrenti gratuite su ogni account. I casi d'uso comuni includono telemarketing con IA, qualificazione dei lead, follow-up di recupero crediti e promemoria di appuntamenti. La conformità TCPA e STIR/SHAKEN è configurata a livello di operatore.
Cosa succede quando l'agente non riesce a gestire una chiamata?
Trasferimento assistito con contesto completo della conversazione. L'umano che risponde vede la trascrizione e i dati strutturati raccolti dall'agente, così il chiamante non deve ripetersi. Le soglie di escalation (tentativi di chiarimento falliti, argomenti sensibili, richieste esplicite del chiamante) sono configurate per ogni agente.
La piattaforma Γ¨ adatta a settori regolamentati?
Sì. SOC 2 Type II, HIPAA con un BAA self-service, GDPR e redazione delle PII sono inclusi. Il deployment on-premise è disponibile per i team con requisiti rigorosi di residenza dei dati.
Quanto tempo ci vuole per passare dalla registrazione a un agente dal vivo?
La maggior parte dei team ha una chiamata di test funzionante entro un'ora e un agente pronto per la produzione entro 1β2 settimane. La piattaforma elabora oltre 50 milioni di chiamate al mese in oltre 3.000 aziende, quindi il percorso di deployment Γ¨ ben collaudato.
I quattro elementi in tempo reale (telefonia, trascrizione, modello linguistico, sintesi vocale) si stanno rapidamente trasformando in commodity. Chiunque puΓ² acquistarli. L'orchestrazione che li trasforma in una telefonata che faresti ascoltare a un cliente Γ¨ dove l'ingegneria si accumula, ed Γ¨ il motivo per cui vale la pena pagare una tariffa di piattaforma al minuto nel 2026.
Il modo piΓΉ veloce per capire dove si trova la linea Γ¨ fare una chiamata reale. La registrazione a Retell AI include $10 di crediti di utilizzo, sufficienti per distribuire un agente di test contro il tuo numero e vedere dove si inseriscono i tuoi sistemi esistenti rispetto a ciΓ² che la piattaforma gestisce end-to-end.
Da lì, il passo successivo naturale è qualunque flusso di lavoro conti di più:
Costruisci con i $10 di crediti su retellai.com.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Un numero di telefono demo di Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)