Retell AIでAI音声アシスタントを作る方法


Retell AIで構築したAI音声アシスタントは、ライブの電話に対応し、リアルタイムで応答し、対話の最中にタスクを実行できます。これらのシステムは、予約を取り、記録を更新し、通話全体を通じてコンテキストを追跡しながらユーザーをワークフローへ案内できます。これは従来型IVRシステムには難しいことです。
Retell AIは、リアルタイムの会話フロー、テレフォニー、アクションの実行を一元的に処理することで、これらのエージェントを構築するための完全なAI音声エージェントプラットフォームを提供します。インバウンドとアウトバウンドの両方の通話に対応し、単なるデモではなく本番運用向けに設計されています。
本番運用対応の音声アシスタントを構築する最速の方法は、speech-to-text、言語モデル、text-to-speechを手作業で組み合わせるのではなく、すでにリアルタイムの音声インタラクションを処理するシステムを使うことです。Retell AIはこのレイヤーを提供します。
音声のストリーミング、ターンの切り替え、応答の配信を処理するリアルタイム音声システムを提供するため、チームはアシスタントの振る舞いと、通話中に実際に何をするかに集中できます。
本ガイドでは、Retellを使って動作するAI音声アシスタントを構築・デプロイする方法を、実際の会話で信頼性を高める要点に焦点を当てて説明します。
構築プロセスは構造化された手順に沿って進みます。各ステップは、アシスタントが実際の通話で確実に動作するために必要なレイヤーを追加します。
エージェントは、音声インタラクション全体を管理するランタイムエンティティです。音声入力の受信、応答生成の調整、通話中の出力配信を担います。
エージェントを作成する際は、ベースとなるシステムパラメータを設定します。これには、応答を生成する言語モデルの選択、音声出力に使う音声の選択、そしてアシスタントの入力処理と応答方法に影響する初期デフォルト値の設定が含まれます。これらの設定は、すべての会話ロジックが動作する環境を定義します。
この段階では、タスク固有の振る舞いは定義しません。目的は、その上にロジックを追加する前に、安定した実行レイヤーを確立することです。
応答エンジンは、通話中にアシスタントがどのように振る舞うかを定義します。これはpromptと構造化された指示によって制御されます。
構成では、以下を明確に定義する必要があります。
応答ロジックは境界を強制しなければなりません。アシスタントは無関係な応答に逸れたり、過剰に説明したりすべきではありません。不足している入力を求め、必要に応じて重要な詳細を確認し、インタラクションを特定の成果に沿わせるべきです。
このレイヤーが一貫性を決定します。正確に定義されていないと、アシスタントは有効な応答を生成してもタスクを完了できない場合があります。
応答の振る舞いを定義したら、会話がどのように進行するかを構造化します。
明確な目的があるユースケースでは、構造化されたフローを定義すべきです。アシスタントは一連のステップを進み、必要な入力が収集され、アクションが正しい順序でトリガーされるようにします。これによりばらつきが減り、不完全なインタラクションを防ぎます。
より柔軟なユースケースでは、prompt駆動のロジックを使って、定義された制約の範囲内で動作しつつアシスタントが適応できるようにできます。
システムは常に状態を維持すべきです。すでに何が収集されたか、何が残っているか、次のステップが何かを追跡しなければなりません。これがないと、アシスタントは質問を繰り返したり、必要なステップを飛ばしたりします。
タスク完了を可能にするために、通話中にアシスタントがアクションを起こせるツールを接続します。
これらのツールは、情報の取得、空き状況の確認、記録の更新、通話転送といった操作を表します。各アクションは、対応するインテントが検出されたときにトリガーできる関数にマッピングすべきです。
Function callingは実行レイヤーとして機能します。アシスタントがアクションを実行する必要を認識すると、関数をトリガーし、結果を処理し、フローを途切れさせることなく会話を続けます。
応答ロジックとアクションレイヤーは整合していなければなりません。アシスタントは、いつ関数を呼び出すべきか、そしてその出力をどのように使ってインタラクションを前進させるかを知っているべきです。
テストは理想的な入力ではなく、実際の通話の振る舞いをシミュレートすべきです。アシスタントは以下のような条件下で評価しなければなりません。
焦点は振る舞いにあります。アシスタントは割り込まれたら話すのを止め、新しい入力に適応し、インタラクションの正しい地点から続けるべきです。
この段階での失敗は、通常、不明確な応答ロジック、弱いフロー構造、または誤ったアクショントリガーから生じます。これらの問題はデプロイ前に解決すべきです。
テストで一貫した動作を示したら、ライブ通話に対応させるためにデプロイします。
Retellではエージェントを電話番号に接続でき、インバウンドとアウトバウンドの両方のインタラクションを可能にします。アシスタントはユーザーの振る舞いが予測できない実際の条件で動作するようになります。
デプロイは、システムを管理されたテストから本番運用へ移行させます。この時点で、インタラクション設計、応答ロジック、アクション処理は、手動の介入なしに連携して機能しなければなりません。
Retell AI音声アシスタントは、3つのレイヤー、すなわち応答ロジック、アクションロジック、call flow制御が正しく定義されている場合にのみ、確実に動作します。
これらは、システムが通話中にタスクを完了するか、通常のユーザーの振る舞いで破綻するかを決定します。
応答ロジックは、インタラクションの各ステップでアシスタントが何を言うかをどのように判断するかを定義します。
以下について明示的であるべきです。
アシスタントは、オープンエンドまたは逸脱する応答を生成すべきではありません。各返答は、不足情報の収集、入力の確認、実行への進行のいずれか、特定の目的に結びついていなければなりません。
明確さは極めて重要です。応答ロジックが曖昧だと、アシスタントは流暢な応答を生成してもインタラクションを前進させず、不完全な成果につながる場合があります。
アクションロジックは、アシスタントがいつタスクを実行すべきか、そしてその実行が会話にどのように収まるかを決定します。
各アクションは以下でなければなりません。
アシスタントは、アクションの処理中にインタラクションを一時停止したり途切れさせたりすべきではありません。リクエストを確認し、実行を処理し、コンテキストを失うことなく会話を続けるべきです。
アクションのタイミングが制御されていないと、システムはアクションを早すぎるタイミングでトリガーしたり、不必要に遅延したり、結果を会話に適切に組み込めなかったりします。
Call flow制御は、インタラクション全体を通じてアシスタントが方向性を維持することを保証します。
システムは以下を追跡しなければなりません。
これにより以下を防ぎます。
適切に定義されたフローは、ユーザーが割り込んだり方向を変えたりしても、インタラクションを構造化されたまま保ちます。これがないと、アシスタントは一貫性を欠き、制御が難しくなります。
音声アシスタントは、インタラクションが予想されるパターンに従うため、テストでは安定しているように見えることがよくあります。実際の通話では、その構造が消えます。破綻はシステムレベルで起こり、複数の要因が組み合わさってアシスタントの構成の不備が露呈します。
失敗は単一の弱いコンポーネントによるものではありません。リアルタイムのインタラクション、実行、制御が一緒に適切に構成されていないときに、システムがどのように振る舞うかの結果なのです。
ユーザーが割り当てられた番号に電話をかけます。Retellエージェントは音声ストリームを受信し、リアルタイムで処理します。
アシスタントは応答し、タスクに沿ったpromptで始めます。ユーザーが要求を述べます。たとえば予約を取ることです。アシスタントはインテントを識別し、必要な情報の収集を始めます。日付、時刻、ワークフローに結びつく必要な詳細など、特定の入力を求めます。
ユーザーが応答するにつれ、システムは状態を維持します。すでに何が収集されたか、何が残っているかを追跡します。ユーザーが一時停止したり不完全な入力を行ったりした場合、アシスタントはインタラクションを最初からやり直すのではなく、直接的なフォローアップを尋ねます。
必要な入力がすべて揃うと、アシスタントは関連する関数をトリガーします。たとえば、接続されたシステムを通じて空き状況を確認します。アクションが実行されている間、アシスタントはリクエストを確認し、次のステップを準備することで継続性を維持します。
関数が結果を返します。アシスタントはその出力をすぐに使い、空き枠を確認し、最終確認を求めます。確認後、別のアクション呼び出しを通じて予約を完了し、明確な完了メッセージで応答します。これが実践におけるコールセンターの自動化の仕組みであり、アシスタントは単一のインタラクション内でタスクを完了します。
デプロイ後、アシスタントが実際の通話でどのようにコミュニケーションするかをレビューします。
可能な限り応答を短くし、不要な言い回しを削除し、質問をより直接的にすべきです。ためらい、混乱、または割り込みを引き起こすあらゆる応答は、明確さのために書き直すべきです。
インタラクションが破綻したり一貫性を欠いたりする箇所を特定します。
これには、欠けているステップ、繰り返される質問、完了に至らないフローが含まれます。アシスタントは、必要な入力を飛ばしたり不必要にやり直したりせずにワークフローを進むべきです。
アクションがどのようにトリガーされるか、そして実行中にアシスタントがどのように振る舞うかを洗練させます。
アクションは正しいタイミングで発生すべきであり、アシスタントは結果を待っている間に沈黙することなく会話を続けるべきです。会話と実行の間の移行はスムーズなままでなければなりません。
基本的なセットアップは最小限の開発で構成できます。本番運用では、外部システムの統合、応答ロジックの定義、アクションの実装のために、通常はコーディングが必要です。
はい。アシスタントは、インタラクション中に関数をトリガーして、データの取得、システムの更新、空き状況の確認、通話転送、またはワークフローの完了を行えます。
現実的な通話条件でエージェントと対話してテストします。割り込み、不完全な入力、インテントの変更をどのように処理するか、そしてアクションが正しくトリガーされ使える結果を返すかを検証します。
はい。アシスタントは電話番号に接続でき、ユースケースに応じてインバウンド通話を受けたり、アウトバウンド通話を発信したりできます。
AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Retell クリニックオフィスのデモ電話番号

Start building smarter conversations today.


.avif)
.avif)