コンテンツにスキップ

コンテキストロットとは何か。なぜ情報を増やすほどAIの精度は落ちるのか

コンテキストロットとは、入力が長くなるにつれて言語モデルの精度が落ちていく、計測可能な現象です。しかもコンテキストウィンドウが埋まるはるか手前から始まります。NoLiMaベンチマークでは、わずか32,000トークンの時点で13モデル中11が短文時の基準の半分を下回り、GPT-4oは99.3%から69.7%へ低下しました。対策はウィンドウを大きくすることではありません。ウィンドウに入れる量を減らすことです。設問に本当に関係する箇所だけを取得し、各主張を元の文書まで引用する。そうすれば背後にどれだけの資料があっても、回答は検証可能なまま保たれます。

更新日

散らばった多数のページが、明示された少数の出典へと絞り込まれていくイラスト

コンテキストロットとは何か

コンテキストロットとは、与えるテキスト量が増えるほど言語モデルの信頼性が下がっていく傾向のことです。短い文書について短く質問すれば、丁寧な回答が返ってきます。ところが同じ質問に60ページの背景資料を付けると、回答は曖昧になり、明らかに本文に書いてあることを見落とし、文書と矛盾する内容を自信たっぷりに述べたりします。

この言葉は2025年6月のHacker Newsの議論から生まれ、その翌月にChromaが技術レポートとして体系化しました。GPT-4.1、Claude 4、Gemini 2.5、Qwen3を含む18モデルを評価した結論は明快です。モデルはコンテキストを均一には使わず、文の取得や複製といった単純な作業でさえ、入力が長くなるほど信頼性が落ちていきます。

最も重要なのは、これが「何ではないか」です。容量オーバーではありません。200,000トークンのウィンドウを持つモデルが、50,000トークンの時点で大きく劣化することがあります。ウィンドウの4分の3はまだ空いています。あふれてもいなければ、切り詰められてもおらず、エラーも出ません。ただ静かに回答の質が落ちるだけです。

実際にどれだけ精度が落ちるのか

働き方を変えるべき程度には落ちます。ICML 2025で発表されたAdobe ResearchのNoLiMaベンチマークは、いずれも128,000トークン以上に対応すると謳う13モデルを検証しました。その最小のウィンドウの4分の1にあたる32,000トークンの時点で、13モデル中11が自身の短文時の基準の半分を下回りました。GPT-4oは99.3%から69.7%へ落ちています。

NoLiMaが切り分けたのは、その理由です。従来のneedle-in-a-haystackテストは、設問と明らかに語句が重なる一文を隠すため、モデルは字面の一致だけで正解できてしまいます。その重なりを取り除き、モデル自身に関連を導かせると、長文コンテキストの性能は崩れます。実務はほぼすべて後者です。契約書はあなたの質問と同じ語を使いませんし、答えは大抵、別々のページにある二つの事実を結ぶ必要があります。

ここが要点です。劣化は作業の種類によって一様ではありません。単純な検索は最も長く持ちこたえ、入力の離れた箇所どうしを行き来する推論が最も速く崩れます。難しい設問ほど、コンテキストロットは早く訪れます。

なぜウィンドウを大きくしても解決しないのか

ウィンドウは最大化すべき数値ではなく、管理すべき資源だからです。追加した1トークンは、他のすべてのトークンとモデルの注意を奪い合います。そしてその注意は均等には配られません。

このパターンは、言葉が生まれる前から記録されていました。Lost in the Middle研究は、モデルは長い入力の冒頭と末尾にある情報を最もよく使い、中間に埋もれた情報については測定可能なほど性能が落ちることを示しました。Chromaのレポートはこれを拡張します。関連情報の位置、もっともらしい紛らわしい記述の有無、さらには周囲の文章がどれだけ整っているかまでが結果を左右します。コンテキストは増やしても中立ではありません。無関係な資料は、肝心な資料に対する精度を実際に損ないます。

ですから、期待外れの回答に対して背景資料をさらに貼り付けるという直感的な対応が、しばしば事態を悪化させています。

ひとつのコンテキストウィンドウ(トークンの予算)プロンプトあなたの文書履歴回答すべてが同じ上限を共有する。超えた分は見えなくなる。

有効なのは、ウィンドウに入れる量を減らすこと

2026年の標準はハイブリッドであり、それは直感を逆転させます。すべてを読み込ませて関連箇所を見つけてくれることを願うのではなく、先に関連箇所を見つけてそれだけを読み込ませ、はるかに小さく密度の高い入力の上でモデルに推論させます。

実務では三つの習慣になります。設問を、それに答えうる文書へと絞ること。ファイルを丸ごと貼るのではなく該当箇所を取得すること。そうすれば100ページの契約書は、100ページのノイズではなく、重要な2条項として寄与します。そして一つの作業セッションを一つの論点に集中させること。長い会話それ自体が長いコンテキストであり、同じように劣化するからです。

これが検索拡張生成(RAG)の目的であり、ロングコンテキストか検索かという選択が、結局は選択ではなかった理由でもあります。推論の段階に短く密度の高い入力を渡すためにこそ、検索の段階が要ります。

検索(RAG)が回答を根拠づける仕組みあなたの質問ライブラリから検索関連する箇所出典付きの回答

コンテキストロットを生き延びるのは引用である

多くの記事が省く、正直な部分をお伝えします。検索は誤答率を下げますが、ゼロにはしません。スタンフォード大学RegLabは、検索に基づく専用の法務リサーチツールを検証し、それでも17%から34%の照会で誤りを計測しました。より良いコンテキストは必要条件であって、十分条件ではありません。

だからこそ、自信ありげな断定よりも引用が重要になります。引用付きの回答は、モデルが正しかったかどうかに依存しないものを手渡してくれます。参照元の該当箇所へのリンクです。10秒で開いて読めます。書いてある通りなら、それで終わりです。違っていれば、あなたが捕まえたことになります。どちらにせよ、何も信じ込む必要はありませんでした。

これがコンテキストロットに対する実践的な備えであり、同時に「速くしてくれる道具」と「依存させる道具」の分かれ目でもあります。判断はあなたが持ち続けます。機械は規模を問わず収集を担い、その過程を示すので、あなたが確認できます。

FAQ

コンテキストロットとコンテキストウィンドウの上限超過は同じものですか?
違います。この二つの混同が最もよくある誤解です。上限超過は明確な限界で、それを超えた内容は切り詰められ、モデルは決して見ません。コンテキストロットは上限のはるか内側、ウィンドウがまったく埋まっていない状態で起こります。何も捨てられず、エラーも出ません。モデルが長い入力を短い入力ほど確実に使えない、というだけです。
どのくらいの長さからコンテキストロットは始まりますか?
明確な閾値はなく、その点も問題の一部です。難しい作業では数万トークンの前半で測定可能な劣化が現れます。NoLiMaでは32,000トークンで13モデル中11が基準の半分を下回りました。単純な検索はかなり長く持ちこたえます。想像より早く始まり、設問に必要な推論の量に応じて悪化すると考えてください。
100万トークンのコンテキストウィンドウがあれば解決しますか?
上限は上がりますが、信頼性は上がりません。ウィンドウが大きければ多く入れられますが、入れたものには同じ不均一な注意が働きます。100万トークンを埋めるより、よく選ばれた2万トークンのほうが良い回答になることもあります。ウィンドウの大きさは容量であって、品質ではありません。
自分の業務でコンテキストロットを減らすにはどうすればよいですか?
与える量を減らし、関連性を高めることです。設問ごとに答えうる文書へ範囲を絞り、ファイルを丸ごと貼らずに該当箇所を取得し、話題が変わったら一つの会話を延々と続けずに新しいセッションを始めてください。そのうえで引用を確認します。コンテキストを短くすることは確率を改善しますが、結果を保証はしないからです。
検索拡張生成(RAG)を使えばコンテキストロットはなくなりますか?
入力を小さく関連性の高い状態に保つことで大きく緩和されますが、誤りがなくなるわけではありません。スタンフォード大学RegLabは、検索に基づく法務AIツールで17%から34%の誤答率を計測しています。検索は入力を良くし、引用は出力を検証させてくれます。両方が必要です。

出典

  1. Hong, Troynikov & Huber「Context Rot:入力トークンの増加がLLMの性能に与える影響」Chroma Research (2025)
  2. Modarressi他「NoLiMa:字面の一致を超えたロングコンテキスト評価」Adobe Research (ICML 2025)
  3. Liu他「Lost in the Middle:言語モデルは長いコンテキストをどう使うか」(TACL 2024)
  4. スタンフォード大学HAI / RegLab:主要なAI法務リサーチツールの信頼性評価 (2024)

関連ガイド