Hvad er inkluderet i en stemme-AI-platform? Telefoni, TTS, STT, LLM'er og hvad du stadig selv skal medbringe

Hvad er inkluderet i en stemme-AI-platform? Telefoni, TTS, STT, LLM'er og hvad du stadig selv skal medbringe
BACK TO BLOGS
ON THIS PAGE
Back to top

De fleste stemme-AI-platforme bundter fire dele til én pris per minut: speech-to-text, sprogmodellen, text-to-speech og den orkestrering, der syr dem sammen til et opkald i realtid. Telefonien kommer ind via SIP, men operatørminutterne, de systemer din agent taler med, og selve samtalelogikken er stadig dine.

Det er hele svaret. Resten af denne guide er til købere, der bliver ved med at hænge fast i det samme evalueringsspørgsmål: "Vent, har vi brug for separate abonnementer til telefoni, TTS, STT og LLM'er, eller er det allerede en del af platformen?"

Hvis du har siddet i et leverandøropkald og sammenlignet en stemme-AI-platform side om side med Twilio, ElevenLabs eller OpenAI og spurgt, hvad der er billigst, så er denne artikel det klareste svar, du får. De leverandører sidder ikke i samme kolonne. Hver enkelt sælger ét lag af stakken. En platform som Retell AI sælger den orkestrerede helhed.

At vide hvilket lag dine penge køber, besvarer fire praktiske spørgsmål:

  • Hvilke kontrakter du underskriver
  • Hvilke fakturaer du modtager hver måned
  • Hvilke ingeniørtimer du bruger, før du går live
  • Hvilke dele af stakken du kan udskifte, når priser eller modeller ændrer sig

Stemme-AI-stakken i et overblik

Enhver stemmeagent, der besvarer et opkald, kører den samme kæde. Lyd kommer ind. Den transskriberes. En model ræsonnerer over transskriptionen. Svaret bliver talt tilbage. Alt sammen streames parallelt.

LagHvad det gørAlmindelige udbydere
TelefoniDirigerer lyd mellem telefon og serverTwilio, Telnyx, Vonage, Avaya
Speech-to-text (STT)Omdanner lyd til tekstDeepgram, AssemblyAI, Whisper
Sprogmodel (LLM)Læser, ræsonnerer, beslutter, svarerGPT-5, GPT-4o, Claude 4.5, Gemini 3.0
Text-to-speech (TTS)Omdanner tekst til talt lydElevenLabs, Cartesia, OpenAI, MiniMax
OrkestreringStreamer, buffer, håndterer turtagning og værktøjskaldStemme-AI-platformen

De første fire er råvarer. Alle bruger stort set de samme udbydere. Det femte er der, hvor teams stille og roligt brænder tre til seks måneders ingeniørarbejde af, når de forsøger at bygge det selv.

Den skjulte omkostning ved "vi syr det selv sammen": Streaming-WebSockets. Sætningsgrænse-buffering. Registrering af stemmeaktivitet. Barge-in-genopretning. Funktionskald midt i opkaldet. Genforsøgslogik på tværs af fire API'er. SIP-integration, der håndterer 8 kHz-codec-særheder. Intet af det leveres ud af boksen.

Har jeg brug for separate abonnementer til telefoni, TTS, STT og LLM'er?

Nej. Ikke med en platform. Med en stemme-AI-platform underskriver du én aftale og får én faktura. Med rå infrastruktur underskriver du fire.

Tre købsveje dukker op i virkelige evalueringer:

1. Bundtet platform: Én kontrakt, én regning, ét dashboard. Du vælger en stemme og en LLM fra dropdown-menuer; platformen håndterer licensering, API-kald og måling. Det er det, de fleste teams vælger de første 90 dage.

2. Rå infrastruktur: Twilio + en STT-udbyder + et LLM-API + en TTS-udbyder, limet sammen med din egen orkestreringskode. Maksimal kontrol, fire sæt legitimationsoplysninger, tre til seks måneders ingeniørarbejde, før du modtager et rigtigt opkald.

3. Hybrid bring-your-own: Platformen håndterer orkestrering og komponenter, men du medbringer din egen SIP-trunk, finjusterede model eller stemmenøgler. Det er der, de fleste produktionsimplementeringer ender efter det første kvartal.

Hvad indeholder prisen per minut?

En platforms overordnede sats dækker orkestrering. Komponenterne ligger ovenpå, og de er gennemsigtige linjeposter, ikke skjulte gebyrer.

Sådan fordeler et typisk mid-market-opkald sig på prissiden:

KomponentTypisk satsBemærkninger
Basisorkestrering~$0,07/minFast
Stemme (Cartesia)~$0,05–$0,07/minElevenLabs/OpenAI ligger højere
LLM$0,003–$0,08/minGemini Flash billigst, GPT-5 højest
Telefoni (indbygget)~$0,015/minEller $0 med din egen SIP-trunk
Alt inklusive (typisk)$0,13–$0,20/minMellemklasse-stemme + kompetent model

To bemærkninger, før du modellerer dette til økonomiafdelingen:

  • Et $0,07-indgangspunkt er ikke en $0,07-produktionsomkostning. Overskriftsprisen dækker kun orkestrering.
  • Tilføjelser ligger uden for prisen per minut: streaming-vidensbase (gratis for de første ti, derefter ~$0,005/min), samtidighed ud over 20 opkald, brandet opkalder-ID. Ingen af dem er nødvendige for at gå live.

Er telefoni bundtet, eller har jeg stadig brug for Twilio?

Ja, og ja. Det afhænger af, hvad du allerede har.

Du kan købe et telefonnummer direkte inde i dashboardet og begynde at modtage opkald på under en time. Du kan også medbringe et eksisterende Twilio-, Telnyx-, Vonage- eller Avaya-nummer via SIP-trunking og springe den videresolgte operatør helt over. Begge veje bruger det samme orkestreringslag under motorhjelmen.

Hurtig beslutningsregel:

  • Starter fra nul? Brug det indbyggede nummer. Hurtigere, billigere, ingen operatøropsætning.
  • Eksisterende operatørkontrakt eller portede numre? Medbring din egen SIP-trunk. Behold dine satser, din STIR/SHAKEN-attestation og din DID-portefølje.
  • Allerede dybt inde i enTwilio-integration? Samme svar: peg trunken mod platformen og importér nummeret.

Du kan skifte senere. Genimport af et nummer tager minutter, ikke migreringsplaner.

Skal jeg betale ElevenLabs separat?

Nej. Den stemme, du vælger fra en dropdown-menu, er inkluderet i prisen per minut.

Det snubler mange evalueringsopkald over, fordi ElevenLabs sælger to forskellige produkter:

  • Sit eget end-to-end Conversational AI-produkt (solgt direkte, ~$0,10/min plus LLM-omkostninger)
  • Sine stemmemodeller, licenseret til platforme, der indlejrer dem og videresælger på per-minut-basis

Hvis du bruger en stemme-AI-platform, får du #2. Ingen separat API-nøgle. Intet separat abonnement. Ingen separat faktura. Licenseringen og målingen sker i backenden.

Samme logik gælder for Cartesia, OpenAI TTS, MiniMax og platformens egne stemmemodeller. Den eneste undtagelse er stemmekloning på virksomhedsniveau, som konfigureres separat for teams, der har brug for en brandspecifik stemme.

Har jeg brug for et OpenAI-abonnement til LLM'en?

Nej. Inferens er bundtet. Du vælger modellen fra en dropdown-menu, og prisen per minut justeres:

  • Billigst: Gemini 3.0 Flash, GPT-5 Nano (brøkdele af en cent)
  • Mellemklasse: GPT-4o, Claude Haiku
  • Ræsonnements-tung: Claude 4.5 Sonnet, GPT-5

Ingen OpenAI-API-nøgle på din side. Ingen Anthropic-konto. Intet Google Cloud-projekt.

Hvis du ønsker at medbringe din egen model (finjusterede vægte, en OpenAI Enterprise-kontrakt, du allerede har underskrevet, eller en selv-hostet Llama-implementering), understøtter platformen en tilpasset LLM-WebSocket. Integrationstrinnene findes i dokumentationen.

Hvornår bliver bring-your-own-model det rette valg?

  • Strenge krav til dataopbevaring
  • Eksisterende LLM-forpligtelser, du gerne vil tjene penge på
  • Domænespecifik finjustering, der materielt slår generelle modeller på din use case

For alle andre er den bundtede vej hurtigere at implementere og lettere at udskifte, når en ny model lander.

Hvad du stadig selv skal medbringe

Her er den del, der overrasker teams. Platformen håndterer samtalen. Du håndterer den forretning, den betjener.

Du medbringerPlatformen håndterer
Vidensbase-indhold (dit servicekatalog, priser, åbningstider, politikker)RAG-hentning og auto-synk
CRM og system of recordWebhook-kald under samtalen
Kalender- og bookingsystemTilgængelighedstjek i realtid og oprettelse af begivenheder
Design af samtaleflowTræk-og-slip-rammeværket til at bygge det i
Eskaleringsregler og routingDen assisterede viderestilling med fuld kontekst

Et par bemærkninger værd at fremhæve:

  • Vidensbasen synkroniserer automatisk fra dit website eller dokumentsæt, men indholdet af de dokumenter er dit ansvar at holde opdateret. Skidt ind, skidt ud, ligesom ethvert RAG-system.
  • CRM-integration kører via webhooks, Make, n8n, Zapier eller en indbygget HubSpot-integration. Agenten kan læse og skrive til Salesforce eller HubSpot under et live-opkald, men skemaet og tilladelserne ligger hos dig.
  • Til flows for at booke møder kører integrationen mod Cal.com, Google Calendar, Calendly eller det bookingsystem, der holder din kalender af record.
  • Der findes skabeloner til almindelige mønstre som AI-bookingagent, AI-telefonsvarer, indgående support, men de faktiske spørgsmål, din agent stiller, og hvad der tæller som et "kvalificeret lead", er beslutninger, kun du kan træffe.
  • Til viderestilling af opkald-eskaleringer definerer du tærsklen. Produktionsimplementeringer automatiserer rutinemæssigt op til 80 procent af de indgående opkald, men hvor du trækker grænsen mellem AI og menneske, er dit valg.

Bundt vs. byg: den ærlige sammenligning

Omkostningsforskellen er lille. Tidsforskellen er enorm.

Bundtet platformBring-your-own-byg
Leverandørrelationer14+
Tid til første live-opkaldUnder en time3–6 måneder
Samlet omkostning per minut$0,13–$0,20$0,13–$0,31
Nødvendigt ingeniørarbejdePrompt + flow-designStreaming-pipeline + genforsøgslogik + observerbarhed + SIP-håndtering
Compliance-kædeEnkelt BAAÉn per leverandør i stakken

En typisk bring-your-own-byg trækker Twilio til telefoni, Deepgram eller AssemblyAI til transskription, GPT-5 eller Claude 4.5 til ræsonnering, ElevenLabs eller Cartesia til stemme, og Pipecat eller LiveKit til orkestrering. Regnestykket per minut lander i omtrent samme nabolag som en bundtet platform.

Det, du betaler for, når du bygger, er ingeniørtid. Registrering af stemmeaktivitet, barge-in-håndtering, funktionskald der overlever fejl midt i opkaldet, observerbarhed der korrelerer fire leverandør-dashboards til ét spor, og SIP-integration der elegant håndterer telefonilydens 8 kHz-codec-særheder. Intet af det leveres ud af boksen.

De fleste moderne transskriptionsmodeller er primært trænet på 16 kHz-lyd. Telefoni giver dig 8 kHz. Nøjagtighedsforskellen på en nybygget pipeline er reel og mærkbar for de, der ringer.

Den forskel mellem måneders rørlægning og dages prompt-engineering er grunden til, at de fleste produktions-stemmeagenter i 2026 lanceres på en platform.

Hvor grænserne ligger

Twilio, ElevenLabs, OpenAI og Retell AI konkurrerer ikke om den samme dollar. De er stablede lag i den samme arkitektur:

  • Twilio, Telnyx, Vonage → telefoni. Flytter lyd mellem telefoner og servere.
  • ElevenLabs, Cartesia, OpenAI TTS, MiniMax → stemmesyntese. Omdanner tekst til tale.
  • OpenAI, Anthropic, Google → sprogmodel-inferens. Den ræsonnerende hjerne.
  • Retell AI → orkestrering plus agent-rammeværket, analyse efter opkald, batchopkald, simuleringstest og den kommercielle indpakning, der gør fire fakturaer til én.

Den rigtige indramning er sjældent "Retell eller Twilio." Det er "Retell oven på Twilio." Samme med OpenAI og ElevenLabs. Det eneste reelle overlap ligger i orkestreringslaget, og siden Retell vs ElevenLabs dækker den mere snævre sammenligning for teams, der vælger mellem en platform og ElevenLabs' eget end-to-end-produkt.

Hvad med HIPAA, SOC 2 og GDPR?

Compliance ligger i platformslaget. SOC 2 Type II, HIPAA med en selvbetjenings-BAA og GDPR er inkluderet uden compliance-tillæg per minut.

Hvor dette betyder mest, er ved den ubundtede byg. Compliance stopper ikke ved orkestrering i en sammensyet stak. Hver leverandør i kæden (STT, LLM, TTS, telefoni) har sin egen BAA-proces, sine egne databehandlingsvilkår og sit eget revisionsspor. Indkøbsteams inden for sundhedssektoren, forsikring og finansielle tjenester vælger normalt bundtet alene af den grund.

Én leverandørgodkendelse bevæger sig hurtigere end fire.

Hvordan bundtet klarer sig i produktion

Tre implementeringer gør afvejningen konkret:

Anker: Stemmeautomatisering på tværs af globale supportcentre, der håndterer millioner af opkald om året i Nordamerika, Europa og Asien. Agenterne opnår 95 %+ talegenkendelsesnøjagtighed på engelsksprogede markeder og kører oven på Ankers eksisterende telefoni frem for en fire-leverandør-pipeline.

Medical Data Systems: Inkasso-operationer via platformen. Teamet håndterer nu 100 % af de indgående opkald med kun en 30 % viderestillingsrate og inkasserer omkring $280.000 om måneden. Den 30 % viderestillingsrate er en forretningsbeslutning, ikke en platformsstandard.

Matic Insurance: En operatør-bot uden for åbningstid, der håndterer support, mødebekræftelse og indtag. I Q1 håndterede botten omkring 8.000 opkald, med svarprocenter der slog den menneskeledede baseline. Botten sidder oven på Matics eksisterende Twilio-relation.

Mønsteret på tværs af alle tre:

  • Platformen ejer agentlaget
  • Kundens eksisterende systemer ejer dataene og arbejdsgangene
  • Operatørrelationen er en separat kontrakt

Det er grænsen mellem bundtet og bring-your-own i virkelige produktionsimplementeringer.

Ofte stillede spørgsmål

Har jeg brug for et ElevenLabs-abonnement for at bruge en stemme-AI-platform?

Nej. Stemmer er indlejret i prisen per minut. Undtagelsen er stemmekloning på virksomhedsniveau, som konfigureres separat.

Er Twilio påkrævet for at køre en AI-stemmeagent?

Nej. De fleste platforme understøtter Telnyx, Vonage, Avaya og enhver SIP-kompatibel operatør via direkte trunking, plus deres egne indbyggede numre. Twilio dominerer kun samtalen, fordi det er den mest almindelige eksisterende operatør.

Kan jeg medbringe min egen LLM?

Ja. Tilpassede LLM'er understøttes via en WebSocket-integration, herunder OpenAI Enterprise-kontrakter, Anthropic-API'et, Gemini og selv-hostede modeller. Du betaler din modeludbyder for inferens og platformen for orkestrering.

Hvordan sammenligner den bundtede pris sig med en gør-det-selv-byg på Twilio + OpenAI + ElevenLabs?

De samlede omkostninger alt inklusive lander i omtrent samme interval: mellem $0,13 og $0,31 per minut. Økonomien per minut er ikke den afgørende faktor. Den afgørende faktor er den ingeniørtid, der spares på orkestreringslaget, hvilket typisk er måneder.

Hvad inkluderer orkestreringslaget?

Streaming af lyd i bidder, sætningsgrænse-buffering mellem sprogmodellen og TTS, turtagning og barge-in, funktionskald under et live-opkald, genforsøg og failover på tværs af de underliggende API'er, simuleringstest, transskriptioner med sentimentscoring og et samlet observerbarheds-dashboard.

Kan jeg bruge en stemme-AI-platform til udgående opkald i stor skala?

Ja. Batchopkald understøtter udgående kampagner med 20 gratis samtidige opkald på hver konto. Almindelige use cases inkluderer AI-telemarketing, leadkvalificering, inkasso-opfølgning og mødepåmindelser. TCPA- og STIR/SHAKEN-compliance konfigureres på operatørniveau.

Hvad sker der, når agenten ikke kan håndtere et opkald?

Assisteret viderestilling med fuld samtalekontekst. Mennesket, der tager over, ser transskriptionen og de strukturerede data, agenten indsamlede, så den, der ringer, ikke behøver at gentage sig selv. Eskaleringstærskler (mislykkede afklaringsforsøg, følsomme emner, eksplicitte anmodninger fra den, der ringer) konfigureres per agent.

Er platformen egnet til regulerede brancher?

Ja. SOC 2 Type II, HIPAA med en selvbetjenings-BAA, GDPR og PII-redigering er inkluderet. On-premise-implementering er tilgængelig for teams med strenge krav til dataopbevaring.

Hvor lang tid tager det at gå fra oprettelse af konto til en live agent?

De fleste teams har et fungerende testopkald inden for en time og en produktionsklar agent inden for 1-2 uger. Platformen behandler 50+ millioner opkald om måneden på tværs af 3.000+ virksomheder, så implementeringsvejen er velbetrådt.

Købsbeslutningen i ét afsnit

De fire realtidsdele (telefoni, transskription, sprogmodel, stemmesyntese) bliver hurtigt til råvarer. Alle kan købe dem. Orkestreringen, der gør dem til et opkald, du ville lade en kunde høre, er der, hvor ingeniørarbejdet hober sig op, og det er grunden til, at et platformsgebyr per minut er værd at betale i 2026.

Den hurtigste måde at fornemme, hvor grænsen ligger, er at foretage et rigtigt opkald. Retell AI's kontooprettelse inkluderer $10 i forbrugskreditter, hvilket er nok til at implementere en testagent mod dit eget nummer og se, hvor dine eksisterende systemer kobles på, kontra hvad platformen håndterer end-to-end.

Derfra er det naturlige næste skridt den arbejdsgang, der betyder mest:

  • AI-kundesupport til afledning af indgående opkald
  • En AI-drevet IVR-erstatning for det telefontræ, dine opkaldere allerede hader
  • En udgående kampagne til de leads, der ligger i dit CRM

Byg med de $10 i kreditter på retellai.com.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live Demo
Prøv vores live demo

Et demonummer fra Retell Clinic Office

Tak! Din indsendelse er modtaget!
Ups! Noget gik galt under indsendelsen af formularen.

Read Other Blogs

Revolutionize your call operation with Retell