Retell AIでAI音声アシスタントを作る方法

Retell AIでAI音声アシスタントを作る方法
ブログ一覧へ戻る
このページの目次
トップへ戻る

Retell AIで構築したAI音声アシスタントは、ライブの電話に対応し、リアルタイムで応答し、対話の最中にタスクを実行できます。これらのシステムは、予約を取り、記録を更新し、通話全体を通じてコンテキストを追跡しながらユーザーをワークフローへ案内できます。これは従来型IVRシステムには難しいことです。

Retell AIは、リアルタイムの会話フロー、テレフォニー、アクションの実行を一元的に処理することで、これらのエージェントを構築するための完全なAI音声エージェントプラットフォームを提供します。インバウンドとアウトバウンドの両方の通話に対応し、単なるデモではなく本番運用向けに設計されています。

AI音声アシスタントを構築する最速の方法とは?

本番運用対応の音声アシスタントを構築する最速の方法は、speech-to-text、言語モデル、text-to-speechを手作業で組み合わせるのではなく、すでにリアルタイムの音声インタラクションを処理するシステムを使うことです。Retell AIはこのレイヤーを提供します。

音声のストリーミング、ターンの切り替え、応答の配信を処理するリアルタイム音声システムを提供するため、チームはアシスタントの振る舞いと、通話中に実際に何をするかに集中できます。

本ガイドでは、Retellを使って動作するAI音声アシスタントを構築・デプロイする方法を、実際の会話で信頼性を高める要点に焦点を当てて説明します。

ステップバイステップ:Retell AIでAI音声アシスタントを構築する

構築プロセスは構造化された手順に沿って進みます。各ステップは、アシスタントが実際の通話で確実に動作するために必要なレイヤーを追加します。

ステップ1:Retell AIエージェントとベース構成をセットアップする

エージェントは、音声インタラクション全体を管理するランタイムエンティティです。音声入力の受信、応答生成の調整、通話中の出力配信を担います。

エージェントを作成する際は、ベースとなるシステムパラメータを設定します。これには、応答を生成する言語モデルの選択、音声出力に使う音声の選択、そしてアシスタントの入力処理と応答方法に影響する初期デフォルト値の設定が含まれます。これらの設定は、すべての会話ロジックが動作する環境を定義します。

この段階では、タスク固有の振る舞いは定義しません。目的は、その上にロジックを追加する前に、安定した実行レイヤーを確立することです。

ステップ2:応答の振る舞いとタスクロジックを定義する

応答エンジンは、通話中にアシスタントがどのように振る舞うかを定義します。これはpromptと構造化された指示によって制御されます。

構成では、以下を明確に定義する必要があります。

  • - アシスタントが担うタスク
  • - そのタスクをどのようにユーザーに案内するか
  • - どの情報を収集または確認する必要があるか

応答ロジックは境界を強制しなければなりません。アシスタントは無関係な応答に逸れたり、過剰に説明したりすべきではありません。不足している入力を求め、必要に応じて重要な詳細を確認し、インタラクションを特定の成果に沿わせるべきです。

このレイヤーが一貫性を決定します。正確に定義されていないと、アシスタントは有効な応答を生成してもタスクを完了できない場合があります。

ステップ3:タスク完了のために会話フローを構造化する

応答の振る舞いを定義したら、会話がどのように進行するかを構造化します。

明確な目的があるユースケースでは、構造化されたフローを定義すべきです。アシスタントは一連のステップを進み、必要な入力が収集され、アクションが正しい順序でトリガーされるようにします。これによりばらつきが減り、不完全なインタラクションを防ぎます。

より柔軟なユースケースでは、prompt駆動のロジックを使って、定義された制約の範囲内で動作しつつアシスタントが適応できるようにできます。

システムは常に状態を維持すべきです。すでに何が収集されたか、何が残っているか、次のステップが何かを追跡しなければなりません。これがないと、アシスタントは質問を繰り返したり、必要なステップを飛ばしたりします。

ステップ4:Function callingを使ってアクションを接続する

タスク完了を可能にするために、通話中にアシスタントがアクションを起こせるツールを接続します。

これらのツールは、情報の取得、空き状況の確認、記録の更新、通話転送といった操作を表します。各アクションは、対応するインテントが検出されたときにトリガーできる関数にマッピングすべきです。

Function callingは実行レイヤーとして機能します。アシスタントがアクションを実行する必要を認識すると、関数をトリガーし、結果を処理し、フローを途切れさせることなく会話を続けます。

応答ロジックとアクションレイヤーは整合していなければなりません。アシスタントは、いつ関数を呼び出すべきか、そしてその出力をどのように使ってインタラクションを前進させるかを知っているべきです。

ステップ5:実際の通話条件下でアシスタントをテストする

テストは理想的な入力ではなく、実際の通話の振る舞いをシミュレートすべきです。アシスタントは以下のような条件下で評価しなければなりません。

  • 応答中の割り込み
  • 不完全または曖昧なユーザー入力
  • 会話の途中でインテントを変えるユーザー

焦点は振る舞いにあります。アシスタントは割り込まれたら話すのを止め、新しい入力に適応し、インタラクションの正しい地点から続けるべきです。

この段階での失敗は、通常、不明確な応答ロジック、弱いフロー構造、または誤ったアクショントリガーから生じます。これらの問題はデプロイ前に解決すべきです。

ステップ6:音声アシスタントを本番通話へデプロイする

テストで一貫した動作を示したら、ライブ通話に対応させるためにデプロイします。

Retellではエージェントを電話番号に接続でき、インバウンドとアウトバウンドの両方のインタラクションを可能にします。アシスタントはユーザーの振る舞いが予測できない実際の条件で動作するようになります。

デプロイは、システムを管理されたテストから本番運用へ移行させます。この時点で、インタラクション設計、応答ロジック、アクション処理は、手動の介入なしに連携して機能しなければなりません。

動作するRetell AI音声アシスタントに必要なコア構成

Retell AI音声アシスタントは、3つのレイヤー、すなわち応答ロジック、アクションロジック、call flow制御が正しく定義されている場合にのみ、確実に動作します。

これらは、システムが通話中にタスクを完了するか、通常のユーザーの振る舞いで破綻するかを決定します。

応答ロジック(アシスタントが何を言うか)

応答ロジックは、インタラクションの各ステップでアシスタントが何を言うかをどのように判断するかを定義します。

以下について明示的であるべきです。

  • 実行されるタスク
  • そのタスクを完了するために必要な情報
  • アシスタントがあるステップから次へどのように移るか

アシスタントは、オープンエンドまたは逸脱する応答を生成すべきではありません。各返答は、不足情報の収集、入力の確認、実行への進行のいずれか、特定の目的に結びついていなければなりません。

明確さは極めて重要です。応答ロジックが曖昧だと、アシスタントは流暢な応答を生成してもインタラクションを前進させず、不完全な成果につながる場合があります。

アクションロジック(アシスタントがいつタスクを実行するか)

アクションロジックは、アシスタントがいつタスクを実行すべきか、そしてその実行が会話にどのように収まるかを決定します。

各アクションは以下でなければなりません。

  • 必要な入力が揃っているときにのみトリガーされる
  • 明確な関数にマッピングされている
  • その関数の結果を使う応答が続く

アシスタントは、アクションの処理中にインタラクションを一時停止したり途切れさせたりすべきではありません。リクエストを確認し、実行を処理し、コンテキストを失うことなく会話を続けるべきです。

アクションのタイミングが制御されていないと、システムはアクションを早すぎるタイミングでトリガーしたり、不必要に遅延したり、結果を会話に適切に組み込めなかったりします。

Call flow制御(通話における方向性の維持)

Call flow制御は、インタラクション全体を通じてアシスタントが方向性を維持することを保証します。

システムは以下を追跡しなければなりません。

  • すでに収集された情報
  • 完了すべき残りの内容
  • 現在どのステップにいるか

これにより以下を防ぎます。

  • 質問の繰り返し
  • 必要な入力の省略
  • 必要なステップを完了せずに先へ進むこと

適切に定義されたフローは、ユーザーが割り込んだり方向を変えたりしても、インタラクションを構造化されたまま保ちます。これがないと、アシスタントは一貫性を欠き、制御が難しくなります。

実際の電話でAI音声アシスタントが破綻する理由

音声アシスタントは、インタラクションが予想されるパターンに従うため、テストでは安定しているように見えることがよくあります。実際の通話では、その構造が消えます。破綻はシステムレベルで起こり、複数の要因が組み合わさってアシスタントの構成の不備が露呈します。

  • 会話構造が実際の使用で維持されない: テストでは入力がクリーンで順序どおりです。実際の通話では、ユーザーは応答の途中で割り込み、予告なくインテントを変え、不完全または重複した入力を行います。アシスタントはこれらすべてを、リセットしたり方向を失ったりすることなくリアルタイムで処理しなければなりません。
  • レイテンシ(遅延)がシステム全体で累積する: 個々のコンポーネントが良好に動作していても、音声認識、応答生成、音声出力にわたって遅延が積み重なります。これらの小さな遅延が重なり合って会話のフローを乱し、ユーザーが同じことを繰り返したり割り込んだりする原因になります。
  • 応答、アクション、フローロジック間の連携の欠如: 応答ロジック、アクションロジック、call flow制御が整合していないと、システムは現実世界の振る舞いから回復できません。割り込み後も話し続けたり、質問を繰り返したり、アクションを早すぎたり遅すぎたりするタイミングでトリガーしたり、必要なステップを完了せずに先へ進んだりする場合があります。
  • 応答するだけのシステムはタスクを完了できない: 応答を生成してもアクションを実行しない音声アシスタントは、依然として手動のフォローアップを必要とします。実際の使用では、アシスタントは同じインタラクション内でデータを取得し、システムを更新し、ワークフローを完了しなければなりません。
  • 失敗はエッジケースではなく通常の条件下で起こる:これらの問題はまれなシナリオでのみ現れるわけではありません。ユーザーが自然に振る舞う標準的なインタラクション中に発生します。適切な構成がないと、アシスタントは極端なケースではなく日常的な使用中に破綻します。

失敗は単一の弱いコンポーネントによるものではありません。リアルタイムのインタラクション、実行、制御が一緒に適切に構成されていないときに、システムがどのように振る舞うかの結果なのです。

デプロイ後にRetell AI音声アシスタントを改善する方法

ユーザーが割り当てられた番号に電話をかけます。Retellエージェントは音声ストリームを受信し、リアルタイムで処理します。

アシスタントは応答し、タスクに沿ったpromptで始めます。ユーザーが要求を述べます。たとえば予約を取ることです。アシスタントはインテントを識別し、必要な情報の収集を始めます。日付、時刻、ワークフローに結びつく必要な詳細など、特定の入力を求めます。

ユーザーが応答するにつれ、システムは状態を維持します。すでに何が収集されたか、何が残っているかを追跡します。ユーザーが一時停止したり不完全な入力を行ったりした場合、アシスタントはインタラクションを最初からやり直すのではなく、直接的なフォローアップを尋ねます。

必要な入力がすべて揃うと、アシスタントは関連する関数をトリガーします。たとえば、接続されたシステムを通じて空き状況を確認します。アクションが実行されている間、アシスタントはリクエストを確認し、次のステップを準備することで継続性を維持します。

関数が結果を返します。アシスタントはその出力をすぐに使い、空き枠を確認し、最終確認を求めます。確認後、別のアクション呼び出しを通じて予約を完了し、明確な完了メッセージで応答します。これが実践におけるコールセンターの自動化の仕組みであり、アシスタントは単一のインタラクション内でタスクを完了します。

デプロイ後の音声アシスタントの改善

応答の振る舞いを洗練させる

デプロイ後、アシスタントが実際の通話でどのようにコミュニケーションするかをレビューします。

可能な限り応答を短くし、不要な言い回しを削除し、質問をより直接的にすべきです。ためらい、混乱、または割り込みを引き起こすあらゆる応答は、明確さのために書き直すべきです。

ワークフローの隙間を修正する

インタラクションが破綻したり一貫性を欠いたりする箇所を特定します。

これには、欠けているステップ、繰り返される質問、完了に至らないフローが含まれます。アシスタントは、必要な入力を飛ばしたり不必要にやり直したりせずにワークフローを進むべきです。

アクションの実行を改善する

アクションがどのようにトリガーされるか、そして実行中にアシスタントがどのように振る舞うかを洗練させます。

アクションは正しいタイミングで発生すべきであり、アシスタントは結果を待っている間に沈黙することなく会話を続けるべきです。会話と実行の間の移行はスムーズなままでなければなりません。

Retell AI音声アシスタントの構築に関するよくある質問

Retell AI音声アシスタントの構築にコーディングは必要ですか?

基本的なセットアップは最小限の開発で構成できます。本番運用では、外部システムの統合、応答ロジックの定義、アクションの実装のために、通常はコーディングが必要です。

Retell AIアシスタントは通話中にアクションを起こせますか?

はい。アシスタントは、インタラクション中に関数をトリガーして、データの取得、システムの更新、空き状況の確認、通話転送、またはワークフローの完了を行えます。

デプロイ前に音声アシスタントをどのようにテストしますか?

現実的な通話条件でエージェントと対話してテストします。割り込み、不完全な入力、インテントの変更をどのように処理するか、そしてアクションが正しくトリガーされ使える結果を返すかを検証します。

Retell AIはインバウンドとアウトバウンドの両方の通話に対応できますか?

はい。アシスタントは電話番号に接続でき、ユースケースに応じてインバウンド通話を受けたり、アウトバウンド通話を発信したりできます。

ROI計算ツール
通話の自動化によるROIを試算

AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。

完了しました! 
送信内容がメールに届いています
エラーが発生しました。フォームの送信中に問題が起きました。
   1
   8
20
エラーが発生しました。フォームの送信中に問題が起きました。

ROI結果

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
ライブデモ
ライブデモを試す

Retell クリニックオフィスのデモ電話番号

ありがとうございます!送信が完了しました!
エラーが発生しました。フォームの送信中に問題が起きました。

Read Other Blogs

Revolutionize your call operation with Retell