コンテンツにスキップ

AIの「分かりません」は、いちばん信頼できる一言かもしれない

「情報源にこの答えは含まれていません」と言うAIは、たいてい失敗しているのではなく、正しく動いています。言語モデルは答えを生成するように作られているため、正直に空白を認めることのほうが難しい振る舞いであり、あなたを守る振る舞いです。この記事では、拒否の読み方を教えます。誠実な証拠の空白と壊れた拒否を見分ける方法、そして「情報が不十分です」を、より鋭い質問や足りない資料の特定に変える方法です。空白は行き止まりではなく、より良いリサーチの始まりになります。

更新日

整った机の穏やかな人物のかたわらで、小さな正直な空箱がティール色に柔らかく光り、読み終えた文書が整然と積まれた温かなイラスト

誰にも祝われない回答

丁寧に質問を組み立てて送ると、ツールがこう返してきます。提供された情報源には、この質問に答えるのに十分な情報が含まれていません。がっかりして、少し苛立つかもしれません。あっちのAIなら、今ごろ自信に満ちた3段落をくれていたのに。

その考えを、少しだけ持ち直してください。まさに逆だからです。あっちのAIがくれる3段落は、パターンともっともらしさから組み立てられたもので、あなたはそれを会議に持ち込むところでした。立ち止まったツールは、本当に難しいことをやってのけました。自分の証拠の縁に気づき、それがどこにあるかをあなたに伝えたのです。間違いにコストが伴う仕事において、この一文は失敗のメッセージではありません。製品が約束を守っている音です。

「分かりません」が難しい振る舞いである理由

言語モデルの生来の本能は、文章をもっともらしく続けることです。答えを求めれば、真実が手元にあってもなくても、答えの形をした何かが出てきます。捏造された引用はこうして生まれます。スタンフォード大学によるAIリーガルリサーチツールのベンチマークでは、ハルシネーションフリーと宣伝された製品でさえ、17%から33%の質問でハルシネーションを起こしていました。空白を埋めることが既定であり、空白を認めることが例外だからです。

誠実な拒否は、誰かがその既定に逆らって設計したことを意味します。システムは検索した証拠を確認し、不十分だと判断し、流暢な推測ではなく気まずい真実を選びました。「情報源にはありません」という表示は、安全装置が白昼堂々と作動している姿です。

誠実な空白か、壊れた拒否か。3つの質問

すべての拒否が称賛に値するわけではありません。3つの質問で見分けてください。

1. 拒否は具体的ですか。誠実な空白は範囲を名指しします。「アップロードされた契約書には早期解約の定めがありません」。壊れた拒否は曖昧または全面的で、情報源に明らかに含まれる内容まで拒否します。

2. 見つけたものを見せられますか。正常なシステムは、答えに届かなくても、最も近い関連箇所を列挙できます。関連すると分かっている情報源から何も見つからないなら、それは証拠の空白ではなく検索の問題を示唆します。

3. 質問を狭めると結果が変わりますか。誠実な空白は精度に反応します。答えを含む情報源に対してどんな言い換えも成功しないなら、その拒否は壊れており、ツールを替えるのが正当です。

空白を、次の一手に変える

誠実な「分かりません」は、何が欠けているかの地図を手渡してくれます。地図の上の手は3つだけです。

質問を狭める。「契約書は解約について何と言っているか」では失敗しても、「解約通知期間を規律する条項はどれか」なら成功することがあります。精度は、検索が正しい箇所を見つける助けになります。

足りない資料を加える。空白は、しばしば文字通りの意味です。最新の規程改定、修正された別紙、より新しい判決が、束の中にないのです。加えて、もう一度尋ねてください。

あるいは、発見として受け入れる。「情報源は沈黙している」こと自体が答えであり、価値ある答えのことがあります。契約書がそのシナリオに触れていないと知ることは、本当の仕事が始まる発見です。

依拠する前に検証するAIが引用付きで下書き出典を開く主張を確認する署名して依拠する裏付けなし?リサーチへ戻る

「言うことを許された」ツールを選ぶ

ここからが少し不都合な話です。ほとんどのAIツールは、知らないときに知らないと伝えるようには設計されていません。デモでは自信に満ちた回答のほうが見栄えがするからです。ツールが自分の空白について誠実でいられるのは、定義された情報源にグラウンディングされ、その縁で止まるよう設計されている場合だけです。

それが要求すべき基準であり、Tatsulokが設計されている基準です。回答はあなたの文書とキュレーション済みコレクションだけから生まれ、すべての主張が該当箇所にリンクし、情報源が尽きたときは即興ではなく、はっきりそう伝えます。この拒否は、我慢している制限ではありません。他のすべての回答を信頼に値するものにしている機能です。

今週の練習です。登録は要りません。使っているAIツールに、手元の資料では答えられないと分かっている質問をしてください。何が起きるかを見てください。それでも答えてくるなら、そのツールの自信に満ちた回答の価値を学んだことになります。立ち止まってそう言うなら、証拠の縁を尊重するツールを見つけたことになり、それがどういう姿かをもう知っています。

FAQ

AIが「情報が不十分です」と言うのはなぜですか?
グラウンディングされたツールでは、検索された情報源に本当に答えが含まれておらず、システムが即興ではなく誠実さを選んだことを意味します。答えの形をした何かを生成するというモデルの既定の本能に、設計で逆らった振る舞いです。
答えを拒否するAIは、常に答えるAIより劣っていますか?
むしろ逆のことが多いです。スタンフォード大学のベンチマークでは、ハルシネーションフリーと宣伝されたツールでも法律質問の17%から33%でハルシネーションが測定されました。空白を認めるツールは真実の地図をくれますが、常に答えるツールは、毎回独自に検証が必要な流暢な文章を手渡してくるだけです。
誠実な空白と壊れた拒否はどう見分けますか?
3つを確かめます。拒否は欠けているものを具体的に示しているか。ツールは見つけた中で最も近い箇所を見せられるか。質問を狭めると結果が変わるか。答えを明らかに含む情報源への曖昧で全面的な拒否は、証拠の空白ではなく検索の問題を示します。
AIが自分の文書から答えられないときはどうすればいいですか?
3つの手のどれかを打ちます。検索が正しい箇所を見つけられるよう質問を狭める。実際に欠けている資料を追加する。あるいは、沈黙そのものを発見として受け入れる。3つとも前進です。同じ質問を繰り返して祈ることだけが、前進ではありません。
ChatGPTに「知らない」と認めさせることはできますか?
提供した情報源だけから答え、不十分なときはそう言うよう指示することはでき、効果もあります。ただしそれはお願いであって保証ではありません。グラウンディングを中心に設計されたツールは、その振る舞いを期待するのではなく、強制します。

出典

  1. スタンフォード大学「Hallucination-Free? 主要AIリーガルリサーチツールの信頼性評価」(研究PDF)
  2. Tatsulokガイド:RAGのハルシネーション率、研究が実際に測定した数字

関連ガイド