Πώς να δημιουργήσετε έναν καλό φωνητικό πράκτορα



Με την πρόοδο του παραγωγικού AI, έχουμε γίνει μάρτυρες σημαντικής ανάπτυξης στα προϊόντα chatbot που κυριαρχούν στην αγορά. Ταυτόχρονα, το φωνητικό AI έχει βελτιωθεί σε τέτοιο βαθμό ώστε οι ομαλές συνομιλίες με το AI να είναι πλέον εφικτές. Είτε δημιουργείτε AI για εισερχόμενες και εξερχόμενες κλήσεις, επαγγελματικές υπηρεσίες, εφαρμογές συντροφικότητας κ.λπ., η φωνή παραμένει βασικό μέρος της εμπειρίας και είναι σημαντική για τη μετατροπή. Όλοι μπορούμε να θυμηθούμε απογοητευτικές εμπειρίες με AI κατά τη διάρκεια κλήσεων — ρομποτικές φωνές, αμήχανες σιωπές, μεγάλες περίοδοι καθυστέρησης (latency), και την ανάγκη να πατάτε κουμπιά για να αλληλεπιδράσετε, τα οποία συλλογικά μειώνουν την ανθρώπινη ποιότητα της εμπειρίας και ενίοτε εκνευρίζουν τους χρήστες.
Πριν προχωρήσουμε κατευθείαν στο πώς να δημιουργήσετε μια σπουδαία φωνητική εμπειρία, ας πάρουμε μια στιγμή να ανακεφαλαιώσουμε πώς συνήθως αλληλεπιδρά ένας άνθρωπος σε μια συνομιλία. Λειτουργούμε με καθυστέρηση <200ms όταν γίνεται η εναλλαγή σειράς, ανταποκρινόμαστε με backchannel όπως χρειάζεται, καταλαβαίνουμε υποσυνείδητα πότε ο άλλος τελειώνει τη σειρά του, κατανοούμε το νόημα και τα συναισθήματα του άλλου, έχουμε γεμιστικές λέξεις μέσα στις προτάσεις μας, σταματάμε να μιλάμε όταν μας διακόπτουν... Η λίστα συνεχίζεται, αλλά το βασικό σημείο που θέλω να τονίσω εδώ είναι ότι υπάρχουν τόσο πολλοί μικροί μηχανισμοί που συμβαίνουν παρασκηνιακά όταν έχουμε μια απλή, ομαλή συνομιλία, και είναι εξαιρετικά ΔΥΣΚΟΛΟ για τις μηχανές να λάβουν υπόψη όλα αυτά και να αποδώσουν σαν άνθρωποι.

Μια κοινή ερώτηση που μας κάνουν συχνά είναι γιατί πρέπει να χρησιμοποιήσω το Retell API --Δεν μπορώ απλώς να συνενώσω ASR (speech-to-text), LLM, TTS (text-to-speech) για να δημιουργήσω μια φωνητική συνομιλία;
Λοιπόν, χμ, θα έπρεπε οπωσδήποτε να το κάνετε αν έχετε τον χρόνο, και να δείτε πόσο μακριά μπορεί να σας πάει μια απλή προσέγγιση συνένωσης. Το νούμερο ένα πρόβλημα που ακούμε από όσους φτιάχνουν το δικό τους φωνητικό σύστημα είναι ότι είναι δύσκολο να μειώσουν την καθυστέρηση (latency)· το νούμερο δύο πρόβλημα που βλέπουμε είναι ότι ο χειρισμός διακοπών είναι δύσκολο να υλοποιηθεί με μια απλή διάταξη· το νούμερο τρία πρόβλημα που βλέπουμε είναι ότι η απόκριση του πράκτορα δεν είναι αρκετά συνομιλιακή ώστε να ακούγεται σαν άνθρωπος. Για να αντιμετωπίσουμε όλα αυτά, ας δούμε μια επισκόπηση των στοιχείων που πρέπει να υπάρχουν και της δουλειάς που πρέπει να γίνει για μια καλή συνομιλιακή εμπειρία φωνητικού AI.
1. Ενσωματώστε με το web frontend ή προγραμματιζόμενα εργαλεία επικοινωνίας όπως το Twilio, το Vonage για να λάβετε τον ήχο του χρήστη.
2. Δουλέψτε με audio bytes και πρωτόκολλα streaming: Ο ήχος του χρήστη από διάφορα frontends (web, τηλεφωνική κλήση) θα έρχεται σε διαφορετικές κωδικοποιήσεις, μορφές και θα αποστέλλεται μέσω διαφορετικών πρωτοκόλλων streaming. Αυτή είναι μια επίπονη εργασία, καθώς τα audio bytes είναι δύσκολα στον χειρισμό και χρονοβόρα στην επεξεργασία. Ρωτήστε οποιονδήποτε μηχανικό γνωρίζετε που δουλεύει με ηχητικά σήματα· θα σας πουν το ίδιο πράγμα.
3. Κατανοήστε τον ήχο: Υπάρχουν διάφορα σήματα από τον ήχο που είναι ζωτικής σημασίας για μια ομαλή συνομιλία.
4. Αποφασίστε αν θα μιλήσετε: κατανοήστε αν ο άλλος θα ολοκληρώσει σύντομα τη σειρά του, ή αν έχει ήδη τελειώσει τη σειρά του, αν περιμένει μια απόκριση ή απλώς κάνει παύση για να διαμορφώσει τις σκέψεις του, κ.λπ. Πρέπει να συνδυάσετε κείμενο, συναίσθημα, τονικότητα, παύση και άλλες ηχητικές εισόδους για να παράγετε αυτήν την απόφαση.
5. Δημιουργία των αποκρίσεων: Η δημιουργία μιας καλής απόκρισης σε αυτό που είπε ο χρήστης είναι δύσκολη και πολύ εξαρτημένη από το σενάριο. Υπάρχουν διάφοροι τρόποι να γίνει αυτό το μέρος και προσαρμόζεται για κάθε περίπτωση χρήσης, οπότε εδώ θα μοιραστώ απλώς μία απλή ροή δημιουργίας απόκρισης.
6. Σύνθεση του ήχου: Συνήθως επιτυγχάνεται με τη χρήση μοντέλων TTS (text to speech), μετατρέψτε το κείμενο απόκρισης σε ήχο. Πρέπει να έχει διακύμανση τόνου και συναισθήματος που ταιριάζει στο σενάριο ώστε να είναι φυσικό. Ιδανικά, η έξοδος TTS θα πρέπει να μεταδίδεται πίσω σε streaming για χαμηλότερη καθυστέρηση.
7. Ανάληψη ενεργειών: Ένα AI που μπορεί να μιλήσει είναι εντυπωσιακό, και ένα AI που μπορεί να αναλάβει ενέργειες είναι ακόμα πιο εντυπωσιακό. Αυτό συνήθως επιτυγχάνεται με λειτουργίες function calling ορισμένων μοντέλων, ή δομημένη έξοδο δεδομένων, ώστε το downstream να μπορεί να κάνει κλείσιμο ραντεβού όταν χρειάζεται, να μπορεί να αναζητά πληροφορίες όταν είναι κατάλληλο.
Νομίζω ότι μέχρι τώρα, οι περισσότεροι θα συμφωνούσαν ότι αυτό δεν είναι τόσο εύκολο όσο η συνένωση ASR, LLM, TTS. Έτσι, επιτρέψτε μου (ξεδιάντροπα) να σας παρουσιάσω πώς μπορεί να βοηθήσει εδώ η Retell AI. Ενσωματώνοντας με τη Retell AI, μπορείτε να εξοικονομήσετε μήνες ανάπτυξης, να απολαύσετε μια φωνητική εμπειρία τελευταίας τεχνολογίας και να καλύψετε όλα τα ακόλουθα:
Τι πρέπει να κάνετε εσείς: συνεχίστε να βελτιώνετε το βασικό σας προϊόν για να το κάνετε καλύτερο, ενώ εμείς φροντίζουμε το μέρος του ήχου. Ορίστε τα μέρη στα οποία πρέπει να δουλέψετε:
Ελπίζω αυτό το blog να σας δώσει μια γενική ιδέα για το πώς να δημιουργήσετε έναν σπουδαίο φωνητικό πράκτορα, και ελπίζω (και ξεδιάντροπα) η προώθησή μου για τη Retell AI να ρίξει φως στο πώς μπορούμε να βοηθήσουμε.
Καλή δημιουργία!
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Ένας αριθμός τηλεφώνου Demo από το Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)