Πώς να δημιουργήσετε έναν καλό φωνητικό πράκτορα

Πώς να δημιουργήσετε έναν καλό φωνητικό πράκτορα
BACK TO BLOGS
ON THIS PAGE
Back to top

Με την πρόοδο του παραγωγικού AI, έχουμε γίνει μάρτυρες σημαντικής ανάπτυξης στα προϊόντα chatbot που κυριαρχούν στην αγορά. Ταυτόχρονα, το φωνητικό AI έχει βελτιωθεί σε τέτοιο βαθμό ώστε οι ομαλές συνομιλίες με το AI να είναι πλέον εφικτές. Είτε δημιουργείτε AI για εισερχόμενες και εξερχόμενες κλήσεις, επαγγελματικές υπηρεσίες, εφαρμογές συντροφικότητας κ.λπ., η φωνή παραμένει βασικό μέρος της εμπειρίας και είναι σημαντική για τη μετατροπή. Όλοι μπορούμε να θυμηθούμε απογοητευτικές εμπειρίες με AI κατά τη διάρκεια κλήσεων — ρομποτικές φωνές, αμήχανες σιωπές, μεγάλες περίοδοι καθυστέρησης (latency), και την ανάγκη να πατάτε κουμπιά για να αλληλεπιδράσετε, τα οποία συλλογικά μειώνουν την ανθρώπινη ποιότητα της εμπειρίας και ενίοτε εκνευρίζουν τους χρήστες.

Ποια η διαφορά μεταξύ φωνητικού AI και ανθρώπου;

Πριν προχωρήσουμε κατευθείαν στο πώς να δημιουργήσετε μια σπουδαία φωνητική εμπειρία, ας πάρουμε μια στιγμή να ανακεφαλαιώσουμε πώς συνήθως αλληλεπιδρά ένας άνθρωπος σε μια συνομιλία. Λειτουργούμε με καθυστέρηση <200ms όταν γίνεται η εναλλαγή σειράς, ανταποκρινόμαστε με backchannel όπως χρειάζεται, καταλαβαίνουμε υποσυνείδητα πότε ο άλλος τελειώνει τη σειρά του, κατανοούμε το νόημα και τα συναισθήματα του άλλου, έχουμε γεμιστικές λέξεις μέσα στις προτάσεις μας, σταματάμε να μιλάμε όταν μας διακόπτουν... Η λίστα συνεχίζεται, αλλά το βασικό σημείο που θέλω να τονίσω εδώ είναι ότι υπάρχουν τόσο πολλοί μικροί μηχανισμοί που συμβαίνουν παρασκηνιακά όταν έχουμε μια απλή, ομαλή συνομιλία, και είναι εξαιρετικά ΔΥΣΚΟΛΟ για τις μηχανές να λάβουν υπόψη όλα αυτά και να αποδώσουν σαν άνθρωποι.

Γιατί είναι δύσκολο να δημιουργήσετε ένα καλό συνομιλιακό φωνητικό AI;

Μια κοινή ερώτηση που μας κάνουν συχνά είναι γιατί πρέπει να χρησιμοποιήσω το Retell API --Δεν μπορώ απλώς να συνενώσω ASR (speech-to-text), LLM, TTS (text-to-speech) για να δημιουργήσω μια φωνητική συνομιλία;

Λοιπόν, χμ, θα έπρεπε οπωσδήποτε να το κάνετε αν έχετε τον χρόνο, και να δείτε πόσο μακριά μπορεί να σας πάει μια απλή προσέγγιση συνένωσης. Το νούμερο ένα πρόβλημα που ακούμε από όσους φτιάχνουν το δικό τους φωνητικό σύστημα είναι ότι είναι δύσκολο να μειώσουν την καθυστέρηση (latency)· το νούμερο δύο πρόβλημα που βλέπουμε είναι ότι ο χειρισμός διακοπών είναι δύσκολο να υλοποιηθεί με μια απλή διάταξη· το νούμερο τρία πρόβλημα που βλέπουμε είναι ότι η απόκριση του πράκτορα δεν είναι αρκετά συνομιλιακή ώστε να ακούγεται σαν άνθρωπος. Για να αντιμετωπίσουμε όλα αυτά, ας δούμε μια επισκόπηση των στοιχείων που πρέπει να υπάρχουν και της δουλειάς που πρέπει να γίνει για μια καλή συνομιλιακή εμπειρία φωνητικού AI.

1. Ενσωματώστε με το web frontend ή προγραμματιζόμενα εργαλεία επικοινωνίας όπως το Twilio, το Vonage για να λάβετε τον ήχο του χρήστη.

2. Δουλέψτε με audio bytes και πρωτόκολλα streaming: Ο ήχος του χρήστη από διάφορα frontends (web, τηλεφωνική κλήση) θα έρχεται σε διαφορετικές κωδικοποιήσεις, μορφές και θα αποστέλλεται μέσω διαφορετικών πρωτοκόλλων streaming. Αυτή είναι μια επίπονη εργασία, καθώς τα audio bytes είναι δύσκολα στον χειρισμό και χρονοβόρα στην επεξεργασία. Ρωτήστε οποιονδήποτε μηχανικό γνωρίζετε που δουλεύει με ηχητικά σήματα· θα σας πουν το ίδιο πράγμα.

3. Κατανοήστε τον ήχο: Υπάρχουν διάφορα σήματα από τον ήχο που είναι ζωτικής σημασίας για μια ομαλή συνομιλία.

  • Κείμενο: συνήθως δημιουργείται από ASR (ασύγχρονη αναγνώριση ομιλίας), πρέπει να είναι σε streaming, πρέπει να είναι όσο το δυνατόν πιο γρήγορο και ακριβές.
  • Συναίσθημα: η κατανόηση της συναισθηματικής κατάστασης του άλλου είναι ζωτικής σημασίας για τους ανθρώπους ώστε να δώσουν μια καλή απόκριση στη συνομιλία.
  • Ποιότητα ηχητικού σήματος: αν υπάρχει θόρυβος φόντου, αν υπάρχει ηχώ.
  • Speaker diarization: αν μιλούν πολλά άτομα, αναγνωρίστε την ταυτότητα του ομιλητή και εντοπίστε ποιος μιλάει σε εσάς και ποιος όχι, κ.λπ.
  • Τονικότητα και άλλα χαρακτηριστικά ειδικά για τον ομιλητή.
  • Παύση: αν ο χρήστης σταματά να μιλάει, συνήθως συμπεραίνεται από το VAD (Voice Activity Detection).

4. Αποφασίστε αν θα μιλήσετε: κατανοήστε αν ο άλλος θα ολοκληρώσει σύντομα τη σειρά του, ή αν έχει ήδη τελειώσει τη σειρά του, αν περιμένει μια απόκριση ή απλώς κάνει παύση για να διαμορφώσει τις σκέψεις του, κ.λπ. Πρέπει να συνδυάσετε κείμενο, συναίσθημα, τονικότητα, παύση και άλλες ηχητικές εισόδους για να παράγετε αυτήν την απόφαση.

  • Το δύσκολο σημείο είναι ότι οι χρήστες μπορούν να τελειώσουν σε οποιοδήποτε σημείο όταν δεν τους γνωρίζετε καλά προσωπικά, και το AI πρέπει να είναι προετοιμασμένο για αυτά τα απότομα τελειώματα.
  • Το να συνεχίζουν οι χρήστες να μιλούν απροσδόκητα είναι λιγότερο πρόβλημα, καθώς το AI μπορεί απλώς να συνεχίσει να ακούει και να αναιρέσει την απόφαση να μιλήσει.

5. Δημιουργία των αποκρίσεων: Η δημιουργία μιας καλής απόκρισης σε αυτό που είπε ο χρήστης είναι δύσκολη και πολύ εξαρτημένη από το σενάριο. Υπάρχουν διάφοροι τρόποι να γίνει αυτό το μέρος και προσαρμόζεται για κάθε περίπτωση χρήσης, οπότε εδώ θα μοιραστώ απλώς μία απλή ροή δημιουργίας απόκρισης.

  • RAG (retrieval augmented generation): Ενσωματώνει έγγραφα, δεδομένα, βάση γνώσεων κ.λπ. σε μια διανυσματική βάση δεδομένων και ανακτά μόνο τις σχετικές πληροφορίες από αυτήν. Αυτές οι σχετικές πληροφορίες θα είναι μέρος του prompt που τροφοδοτείται στο LLM.
  • LLM: Αυτό μπορεί να είναι ένα fine-tuned μοντέλο που φιλοξενείτε ο ίδιος, ή κλήσεις API προς παρόχους. Με βάση τις σχετικές πληροφορίες από το προηγούμενο βήμα και κάποια άλλα prompts που είναι προσαρμοσμένα για τον χρήστη, δημιουργήστε μια απόκριση και μεταδώστε την απόκριση πίσω σε ένα σύστημα δημιουργίας φωνής.
  • Επαλήθευση: για ορισμένες φράσεις/λέξεις υψηλού διακυβεύματος, ίσως επαληθεύστε πριν τη μετάδοση πίσω.

6. Σύνθεση του ήχου: Συνήθως επιτυγχάνεται με τη χρήση μοντέλων TTS (text to speech), μετατρέψτε το κείμενο απόκρισης σε ήχο. Πρέπει να έχει διακύμανση τόνου και συναισθήματος που ταιριάζει στο σενάριο ώστε να είναι φυσικό. Ιδανικά, η έξοδος TTS θα πρέπει να μεταδίδεται πίσω σε streaming για χαμηλότερη καθυστέρηση.

7. Ανάληψη ενεργειών: Ένα AI που μπορεί να μιλήσει είναι εντυπωσιακό, και ένα AI που μπορεί να αναλάβει ενέργειες είναι ακόμα πιο εντυπωσιακό. Αυτό συνήθως επιτυγχάνεται με λειτουργίες function calling ορισμένων μοντέλων, ή δομημένη έξοδο δεδομένων, ώστε το downstream να μπορεί να κάνει κλείσιμο ραντεβού όταν χρειάζεται, να μπορεί να αναζητά πληροφορίες όταν είναι κατάλληλο.

  • Όταν αναλαμβάνετε ενέργειες, βεβαιωθείτε ότι ο πράκτοράς σας μπορεί ακόμα να αποκρίνεται.
  • Μια συγκεκριμένη περίπτωση χρήσης αυτού είναι η μεταβίβαση κλήσης ή ο τερματισμός της κλήσης.

Τι μπορεί να κάνει η Retell AI για ένα καλό συνομιλιακό φωνητικό AI;

Νομίζω ότι μέχρι τώρα, οι περισσότεροι θα συμφωνούσαν ότι αυτό δεν είναι τόσο εύκολο όσο η συνένωση ASR, LLM, TTS. Έτσι, επιτρέψτε μου (ξεδιάντροπα) να σας παρουσιάσω πώς μπορεί να βοηθήσει εδώ η Retell AI. Ενσωματώνοντας με τη Retell AI, μπορείτε να εξοικονομήσετε μήνες ανάπτυξης, να απολαύσετε μια φωνητική εμπειρία τελευταίας τεχνολογίας και να καλύψετε όλα τα ακόλουθα:

  • Χαμηλή καθυστέρηση (latency): Εφαρμόζουμε βελτιστοποιήσεις σε κάθε βήμα, ώστε η καθυστέρηση να μειώνεται στο ελάχιστο για το μέρος του ήχου. Σημειώστε ότι το μέρος δημιουργίας απόκρισης είναι ακόμα στα χέρια σας, οπότε έχουμε μικρό έλεγχο πάνω σε αυτό. Το demo μας είναι ~800ms μεταξύ της στιγμής που ο χρήστης σταματά και της απόκρισης του πράκτορα.
  • Χειρισμός διακοπών: Ο χρήστης μπορεί να διακόψει ανά πάσα στιγμή, και ο πράκτορας αντιδρά αστραπιαία σε αυτό σαν πραγματικός άνθρωπος.
  • Ενσωμάτωση ήχου: Μπορούμε να συνδεθούμε απευθείας με το Twilio, και έχουμε κάνει open-source τον κώδικα web frontend.
  • Δουλέψτε με audio bytes: το έχουμε καλύψει και μπορούμε να σας εξοικονομήσουμε εκατοντάδες ώρες.
  • Κατανόηση ήχου: εξάγουμε γνώσεις από τον ήχο με τη χαμηλότερη καθυστέρηση και σας στέλνουμε μεταγραφές σε πραγματικό χρόνο (άλλα σήματα έρχονται σύντομα).
  • Απόφαση για το πότε να μιλήσετε: έχουμε το δικό μας μοντέλο εναλλαγής σειράς και θα συνεχίσουμε να το βελτιώνουμε ώστε να παίρνει καλύτερες αποφάσεις για το πότε να μιλήσει.
  • Σύνθεση ήχου: ενσωματωνόμαστε με διάφορους παρόχους TTS και προσλάβαμε ηθοποιούς φωνής για να δημιουργήσουμε φυσικές φωνές κατάλληλες για συνομιλία.
  • Γρήγορο demo & dashboard: έχουμε ρυθμίσει το dashboard μας ώστε να υποστηρίζει τη δημιουργία ενός demo μέσα σε 2 λεπτά.
  • Τεχνογνωσία πεδίου & υποστήριξη: έχουμε τεχνογνωσία πεδίου στον ήχο, τη μοντελοποίηση, τη δημιουργία πρακτόρων. Είμαστε εδώ για να βοηθήσουμε όποτε αντιμετωπίζετε προβλήματα.

Τι πρέπει να κάνετε εσείς: συνεχίστε να βελτιώνετε το βασικό σας προϊόν για να το κάνετε καλύτερο, ενώ εμείς φροντίζουμε το μέρος του ήχου. Ορίστε τα μέρη στα οποία πρέπει να δουλέψετε:

  • Δημιουργία απόκρισης: αν και υποστηρίζουμε τη δημιουργία demo στο dashboard, συνειδητοποιούμε ότι για κάθε σενάριο, η διαδικασία δημιουργίας απόκρισης μπορεί να είναι δραστικά διαφορετική. Επομένως, το API μας θα ενσωματώσει εύκολα την προσαρμοσμένη σας λύση δημιουργίας απόκρισης, ανεξάρτητα από το αν πρόκειται για μια απλή κλήση OpenAI ή για μια περίπλοκη διάταξη πράκτορα.
  • Ανάληψη ενεργειών: για να αναλάβει ενέργειες ο φωνητικός πράκτορας, πιθανώς θα πρέπει να ενσωματώσετε με διαφορετικά εργαλεία (ημερολόγια, CRM, κ.λπ.). Εναπόκειται σε εσάς να αποφασίσετε πότε θα αναλάβετε ενέργειες και ποιες. Μην ξεχάσετε να συνεχίζετε να δημιουργείτε αποκρίσεις ενώ αναλαμβάνετε ενέργειες.
  • Συγκεκριμένη λογική κλήσης: διαφορετικές περιπτώσεις χρήσης θα μεταβιβάζουν / τερματίζουν κλήσεις διαφορετικά, και εναπόκειται σε εσάς να αποφασίσετε τις λεπτομέρειες σχετικά με τη ροή κλήσης. Αυτό μπορεί να ρυθμιστεί μέσω function calling.

Ελπίζω αυτό το blog να σας δώσει μια γενική ιδέα για το πώς να δημιουργήσετε έναν σπουδαίο φωνητικό πράκτορα, και ελπίζω (και ξεδιάντροπα) η προώθησή μου για τη Retell AI να ρίξει φως στο πώς μπορούμε να βοηθήσουμε.

Καλή δημιουργία!

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live Demo
Δοκιμάστε το Live Demo μας

Ένας αριθμός τηλεφώνου Demo από το Retell Clinic Office

Ευχαριστούμε! Η υποβολή σας ελήφθη!
Ωχ! Κάτι πήγε στραβά κατά την υποβολή της φόρμας.

Read Other Blogs

Revolutionize your call operation with Retell