AIにおけるグラウンディングとは?AIモデルが事実に忠実であり続ける仕組みを解説

AIにおけるグラウンディングとは?AIモデルが事実に忠実であり続ける仕組みを解説
ブログ一覧へ戻る
このページの目次
トップへ戻る

グラウンディングは、AIモデルが事実を捏造するのを止めるための手法です。記憶だけから回答する代わりに、グラウンディングされたモデルは実在するソース資料(自社のドキュメント、データベース、ライブAPI)を取り込み、そこから回答します。これは、AIを顧客の前に出せるほど信頼できるものにするための最大のレバーです。RAGはそれを実現する最も一般的な方法ですが、唯一の方法ではありません。 

以下では、グラウンディングとは何か、RAGやファインチューニングとの違い、チームが用いる5つの手法、その構築方法、測定方法、そしてなぜライブの電話で最も難しくなるのかを解説します。

AIにおけるグラウンディングの意味と、人々が混同し続ける2つの定義

「グラウンディング」という言葉には2つの異なる考え方が共存しており、その混乱はあらゆる場面で見られます。

1つ目は認知科学から来た古い方の考え方です。記号接地問題(シンボルグラウンディング問題)と呼ばれるものです。これは、「apple」という単語などの記号が、他の記号だけを指し示すのではなく、それが指す現実の物とどう結びつくのかを問うものです。この問いは、システムが言語をセンサーや物理世界に結びつけなければならないロボティクスや身体性を持つAIにおいて重要です。

2つ目は、あなたがほぼ間違いなくここに来た理由の方です。本番環境のAIにおいて、グラウンディングとはモデルの出力を検証可能なソース資料に結びつけることを意味し、その回答が学習中に拾ったパターンではなく、実在する具体的な情報にまでたどれるようにします。グラウンディングされた回答は検証できます。グラウンディングされていない回答は、自信ありげな当て推量です。

本稿は2つ目の種類についてのものです。エンジニアが「エージェントをグラウンディングした」と言うとき、それはモデルが学習中に吸収したものではなく、既知の信頼できる情報源(source of truth)から回答していることを意味します。

グラウンディングされていないモデルが、自信満々に事実を間違える理由

言語モデルは予測エンジンです。それは、流暢で説得力のあるテキストを生成するのが上手くなるまで、シーケンス内の次の単語を何度も何度も推測するよう学習されました。誰もそれを「正しくある」ように学習させたわけではありません。「正しく聞こえる」ように学習させたのです。

そのギャップこそがハルシネーションの発生源です。モデルに、半分しか知らないこと、学習のカットオフより後のこと、あるいはあなたのビジネスに固有のことを尋ねると、それでも回答してきます。最もそれらしく聞こえる単語で穴を埋めるのです。出力は文法的に正しく、自信に満ち、そして時に間違っています。

カジュアルな雑談なら、間違った回答は煩わしいだけです。しかし、返金ポリシーを提示したり、投与量を確認したり、発信者に残高を伝えたりするエージェントにとって、間違った回答は責任問題になります。グラウンディングは、モデルが回答する瞬間に事実を手渡し、それに縛りつけることでギャップを埋めます。

グラウンディングあり対なし:同じ質問、2つの異なる回答

顧客が「私の残高はいくら残っていて、自動引き落としの日はいつですか」と尋ねる場面を想像してください。

グラウンディングされていない場合、モデルはそのアカウントにアクセスできません。そこで、回答らしい形をしたものを生成します。「残高は$42.50で、自動引き落としは15日に実行されます」。もっともらしい。そして捏造です。数字はどこからともなく出てきたものです。

グラウンディングされている場合、エージェントはまずあなたの請求システムを呼び出し、実際の記録を取得し、そこから回答します。「残高は$128.40残っており、自動引き落としは22日に設定されています」。同じ質問ですが、今度は回答が信頼できる記録システム(system of record)に結びついています。誰かがその数字がどこから来たのか尋ねても、正確なソースを指し示せます。

それがすべてです。グラウンディングは「正しく聞こえる」を「正しい」に変えます。その理由は次のとおりです。

グラウンディング対RAG対ファインチューニング:どれが目標で、どれが手法か

この3つは同じ意味で使われがちですが、そうすべきではありません。グラウンディングは目標です。出力を真実に結びつけること。RAGとファインチューニングは、それに到達するために使う手法です。 

これらを混同すると、チームがモデルをファインチューニングしておきながら、なぜまだ事実を捏造するのかと悩むことになります。

アプローチ

それは何か

最適な用途

最新または非公開のデータを扱えるか?

ハルシネーションを減らすか?

グラウンディング

成果:検証可能なソースに結びついた回答

あらゆる本番システムにとっての最終目標

はい、設計上そうなっている

直接的に

RAG

質問時に関連ドキュメントを取得し、そこから回答する

大規模または急速に変化するナレッジベース

はい

はい、主要な手法

ファインチューニング

厳選されたデータセットでモデルの重みを再学習する

トーン、フォーマット、ドメインのスタイル、限定的なタスク

いいえ、知識は学習時に固定される

単独では減らさない

要約すると、ファインチューニングはモデルの話し方や得意なドメインを変えますが、学習時に知識を重みに焼き込むため、古くなり、依然としてソースを引用できません。RAGは質問の瞬間に最新かつ具体的な事実を注入します。もしあなたの問題が「モデルが自社データについて間違っている」ことなら、ファインチューニングがそれを解決することはめったにありません。グラウンディングが解決します。

チームが実際にAIシステムをグラウンディングする5つの方法

RAGばかり注目されますが、それは1つの選択肢に過ぎません。ほとんどの本番システムは、これらのいくつかを組み合わせています。

  1. 検索(RAG):ナレッジベースを検索して質問に関連するチャンクを見つけ、それをプロンプトに投入し、そこからモデルに回答させます。信頼できる情報が頻繁に変わる多数のドキュメントにまたがって存在する場合に最適です。
  2. ツール/関数呼び出し:回答の途中でモデルにAPIを呼び出させたりデータベースをクエリさせたりします。注文状況、在庫、カレンダー、アカウント記録など。記録システムがグラウンドトゥルースなので、回答はあなたのデータと同じくらい最新です。
  3. 構造化データの参照:自由テキスト検索の代わりに、データベースから特定の1フィールドを引き出します。追跡番号、価格、ポリシーの上限など。必要なものが正確に分かっている場合、検索よりも厳密で信頼性が高くなります。
  4. 引用の強制:提供されたソースからのみ回答し、各主張の出所を付記するようモデルに指示します。ある記述を裏付けられない場合は、推測する代わりにそう述べます。これが回答を監査可能にするものです。
  5. ナレッジグラフ:エンティティとその関係を構造化グラフで結びつけ、モデルが推測ではなく明示的にリンクされた事実に基づいて推論するようにします。エンティティ同士の関係がエンティティそのものと同じくらい重要な場合に有用です。

自社のAIシステムをグラウンディングする方法、ステップバイステップ

実行可能な手順を順番に:

  1. 信頼できる情報源を定める:どのドキュメント、データベース、APIを権威あるものとするかを決めます。乱雑または古いソースにグラウンディングすると、自信満々の間違った回答が生まれるため、これはほとんどのチームが投資を怠っているステップです。
  2. 検索可能にする:ドキュメントをチャンク化してインデックスするか、モデルが呼び出せるクリーンなAPIとしてデータを公開します。検索の品質はここから始まります。
  3. 質問時に適切なコンテキストを引き出す:すべてではなく、最も関連性の高いいくつかの断片を取得します。コンテキストは多ければよいわけではありません。適切なコンテキストが良いのです。
  4. モデルに制約をかける:システムプロンプトで、取得した資料からのみ回答し、答えがそこにない場合は「わかりません」と言うよう指示します。記憶に頼ることを許されたモデルは、そうします。
  5. トレーサビリティを必須にする:各回答の背後にあるソースをエージェントが保持し、理想的には表示するようにします。後からどの応答も再構成できるようにしたいからです。
  6. フォールバックを構築する:エージェントが回答をグラウンディングできない場合、どこかに振り分けます。明確化のための質問、あるいは人間へ。沈黙も推測も、どちらもより悪い選択です。
  7. 評価して監視する:グラウンディングは設定して放置するものではありません。ソースはずれていき、検索は取りこぼします。それを測定しましょう。それが次のパートにつながります。

グラウンディングが機能しているかを知る方法

「良くなった気がする」は指標ではありません。以下はいくつかの指標です:

  • グラウンデッドネス(忠実性):回答内のすべての主張は、取得したソースにまでたどれるか?ラベル付きのセット、またはLLMを審査者とする構成でスコア化できます。
  • 引用カバレッジ:回答のうち、実在する正しいソースを含むものの割合。カバレッジが低いということは、モデルがまだ自由に振る舞っているということです。
  • 検索品質:正しい答えがナレッジベースに存在するとき、検索器はそれを引き出せるか?優れたモデルも、検索が悪ければ失敗します。
  • 回答精度:既知の答えを持つ実際の質問の固定テストセットを実行し、構成を変更するにつれてスコアを追跡します。

本番環境では、さらに2つのシグナルが重要です。エージェントが「わかりません」と言う頻度(健全な割合であれば、ソースを尊重していることを意味します)と、エスカレーションする頻度です。定期的にトランスクリプトを見直すことで、指標では見逃す失敗を捉えられます。

AIをグラウンディングするのが最も難しい場所:ライブの音声エージェント

上記のすべては、チャットウィンドウでも十分に難しいものです。電話では、音声特有の理由でさらに難しくなります。

1つ目はレイテンシです。テキストでは、読者は検索の往復のために1秒待ってくれます。電話では、1秒の間があると回線が切れたように感じられます。取得し、グラウンディングし、自然な会話のリズムの中で話し始めなければならず、多くの場合、完全な回答が計算される前に文を始めることになります。

2つ目は文字起こしです。モデルは音声認識器が聞き取った内容に基づいてグラウンディングします。もし「15」の代わりに「50」と聞き取ったり、口座番号を取り違えたりすれば、エージェントは間違った前提に自信満々でグラウンディングします。世界一クリーンな検索でも、悪いトランスクリプトは修正できません。

3つ目は引用です。発信者はソースのリンクをクリックできません。信頼は、エージェントが正しい記録を引き出してそれを明快に述べること、そしてそれができないときに人間へ簡単につながる経路があることから生まれなければなりません。

ここが音声プラットフォームの真価が問われるところです。Retell AI では、ナレッジベースがサイトやドキュメントから自動同期するストリーミングRAGを実行するため、エージェントは古い学習データではなく最新の情報から回答します。リアルタイムの関数呼び出しにより、AI音声エージェントは通話の途中であなたのシステムからライブデータを引き出し、回答を実際の記録にグラウンディングできます。エージェントが何かを安全にグラウンディングできない場合、通話転送が完全なコンテキストを添えて人へ引き継ぎます。そして通話後分析が、後からグラウンディングの失敗を捉えるためのトランスクリプトとスコアリングを提供します。これが先ほどの監視ステップです。電話サポートのために会話型AIプラットフォームを評価しているなら、テストすべきはデモではなく、実際の通話条件下でのグラウンディング挙動です。

グラウンディングが依然として不十分な点と、それにどう対処するか

グラウンディングはハルシネーションを減らします。しかし、なくすわけではなく、そうでないふりをすると痛い目を見ることになります。

  • 検索の取りこぼし:答えはナレッジベースにあるのに検索器がそれを引き出せず、モデルは「わかりません」と言うか、さらに悪いことに推測に頼ります。最終回答だけでなく、検索品質を直接測定することで対処します。
  • 古いまたは矛盾するソース:ナレッジベースが最新でなければ、エージェントは完全な自信をもって間違った真実にグラウンディングします。ソースを最新に保ち、モデルに届く前に矛盾を解消しましょう。
  • 過剰な制約:モデルを縛りすぎると機械的になり、合理的な推論を拒否し、マニュアルのように読めてしまいます。グラウンディングの精度と自然な会話は互いに引っ張り合うので、そのバランスを調整します。
  • 正しいコンテキストの誤読:正しいソースを手渡されても、モデルはそれを誤引用したり誤って帰属させたりすることがあります。医療、法律、金融における重大な回答では、人間を介在させ続けましょう。

これらはいずれもグラウンディングを省く理由にはなりません。それらは、グラウンディングを測定し、誠実なフォールバックを設計する理由です。「確認できる者を連れてきます」と言うエージェントは、毎回答えを捏造するエージェントに勝ります。

AIにおけるグラウンディングに関するよくある質問

グラウンディングはRAGと同じですか?

いいえ。グラウンディングは目標であり、回答を実在するソースに結びつけることです。RAGはそこに到達する最も一般的な手法ですが、関数呼び出し、データベースの参照、引用の強制によってもグラウンディングできます。

グラウンディングはハルシネーションをなくしますか?

大幅に減らしますが、ゼロにはしません。モデルはソースを誤読したり、古いソースから回答したりすることがあります。グラウンディングに加えて測定とフォールバックがあることで、本番グレードの信頼性に到達できます。

RAGなしでモデルをグラウンディングできますか?

はい。ツール/関数呼び出しは回答をライブのシステムデータにグラウンディングし、構造化された参照は特定のフィールドを引き出し、引用の強制はモデルを提供されたソースに縛りつけます。RAGは道具箱の中の1つのツールです。

グラウンディングはファインチューニングより優れていますか?

それらは異なる問題を解決します。ファインチューニングはトーンやドメインの挙動を形作りますが、知識を学習時に固定します。グラウンディングは回答時に最新かつ具体的な事実を供給します。「モデルが自社データについて間違っている」という問題には、グラウンディングが解決策です。

AI音声エージェントはライブの通話でどうやってグラウンディングを維持するのですか?

ナレッジベースからリアルタイムで取得し、ライブデータのために記録システムを呼び出し、回答を確認できないときは人間にエスカレーションします。それらすべてを、自然な発話のレイテンシ予算の中で行います。

トップクラスのモデルを使っていても、グラウンディングは必要ですか?

はい。より強力なモデルはより流暢で、多くの場合より正確ですが、それでもあなたの非公開データや最新データへの組み込みアクセスは持っていません。グラウンディングは、あらゆるモデルをあなたの真実に結びつけるものです。

ROI計算ツール
通話の自動化によるROIを試算

AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。

完了しました! 
送信内容がメールに届いています
エラーが発生しました。フォームの送信中に問題が起きました。
   1
   8
20
エラーが発生しました。フォームの送信中に問題が起きました。

ROI結果

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
ライブデモ
ライブデモを試す

Retell クリニックオフィスのデモ電話番号

ありがとうございます!送信が完了しました!
エラーが発生しました。フォームの送信中に問題が起きました。

Read Other Blogs

Revolutionize your call operation with Retell