SEO最前線

SEOコンサルタントが最新のSEO情報をお届けします

AI可視性ランキングは不安定 新しい研究が示す統計的ノイズ

概要

AIの可視性追跡データは完全に信頼できるものではありません。生成モデルは異なる応答をすることが多いため、ダッシュボードに表示される引用シェアやランキングは、変化し続けるターゲットの一時的なスナップショットであり、固定された事実ではないからです。競合との差が本物なのか、単なる測定間の変動なのかを区別する方法を提供する新しいIQRushの論文が発表されました。この研究は、データ量だけでは definitively な結論が出せないことを示しており、同様の反復測定による発見は別のチームによっても発表され、その知見の信頼性を裏付けています。SearchGPT、Gemini、PerplexityなどのAIに同じ質問を繰り返し投げかけると、毎回異なる情報源が生成されることがあります。これらは各応答に意図的なランダム性を加えるように設計されており、各引用は多くの可能性のあるURLの一つにすぎません。以前の研究では、例えばTom's GuideRunner's Worldよりも多く引用されたように見えても、大きな誤差範囲のために数値が重複しており、1回のサンプルだけではTom's GuideRunner's Worldを上回ったと正確には言えませんでした。新しい論文は、「ランキングが本当に意味を持つにはどれくらいのデータが必要か」という問いに取り組むことで、この誤りを防ぐことを目的としています。ランキングが信頼できると判断するには、2つの条件が同時に満たされる必要があります。第一に、十分な回答が集まり、トップサイトが明確に際立ち始めることで、順位が安定する必要があります。第二に、トップサイト間の差が十分大きく、各サイトの誤差範囲よりも大きい必要があります。差が小さい場合、それは統計的なノイズである可能性が高いです。30のプラットフォームとトピックに関するテストでは、両方の条件が満たされるまでに必要な回答数(引用のある回答のみをカウント)は33から94の間でした。しかし、30件中3件のテスト(すべてSearchGPT)では、125の質問の後でもトップサイトが酷似しており、この時点に達しませんでした。どのプラットフォームやトピックにも適用できる単一のカットオフ値は存在しません。SparkToroの以前の調査では、AIツールは同じ質問に対して99%以上の確率で異なるブランドリストを提示することが判明していましたが、今回の論文は、結果が安定するまでに何回質問する必要があるかについて、より明確な答えを提供しています。Rand Fishkin氏は、AI可視性追跡に資金を投じる前に、プロバイダーに「計算の根拠(shows their math)」を示すよう求めることを推奨しています。IQRushの論文は、直感に頼らずに十分な実行回数を判断するためのシンプルな停止ルールを提供します。ダッシュボードに表示される数字は単なる単一のサンプルにすぎません。それを信頼する前に、トラッカーが繰り返し同じチェックを行い、範囲(range)を報告しているか、それとも一度データを取得して「きれいな数字」を示しているかを確認すべきです。後者はむしろ警告サインとなる可能性があります。コンテンツ変更後の「改善」も誤解しやすいことがあります。例えば、SearchGPTでの引用シェアが3ポイント増加したとしても、それは努力の成果ではなく、一連の実行における自然な変動の範囲内である可能性があります。真の成果を主張するには、変更前と変更後に複数回の測定を行う必要があります。必要なデータ量は、測定対象のプラットフォームによっても異なります。Geminiは一つの回答内で同じ少数のサイトに引用を集中させる傾向があり、多くの引用が同じ情報を示します。一方、SearchGPTは回答あたりの引用数は少ないですが、それらを分散させるため、各回答がより多くの独立した情報を提供します。したがって、同じ数の回答でも、エンジンによって得られる確信度は異なります。時には「まだデータが不十分」という正直な判断を下すことも重要です。30のテストのうち3つは、設定された予算内でトップサイトを明確に分離できませんでした。データが裏付けないランキングを公表するよりも、公開を控えることが正しい判断です。「データ不足」を伝えられるトラッカーは、毎回自信満々な順位を出すトラッカーよりも価値があります。ランキングの上位は最も信頼できる部分です。十分な回答があれば、リーダーたちは中間層や下位層から引き離されますが、それでも完全に正確ではありません。中央部や下位になると誤差範囲は急速に広がり、隣接する順位はコインの裏表のようになります。上位10位でさえ完璧ではなく、上位10位サイトの典型的な誤差範囲は約5ポジション、5分の1は10ポジションを超えていました。リーダーを信頼し、中位と下位は概算として扱い、リストの前面を越えた正確な順位は報告すべきではありません。ただし、この研究は査読済みの完成された研究ではありません。3つのエンジンにわたる30のプラットフォームとトピックのテストに基づいており、実際のユーザー検索ではなくChatGPTによって生成された質問を使用しています。また、引用を含む回答のみをカウントしています。そのため、正確な数値が自分のトピックにそのまま適用されるわけではなく、これは「問題の全体像」として捉えるべきです。この研究は、「AIの可視性レポート」が広告やアナリティクスレポートがたどった道、つまり「誤差範囲を伴う数字」へ向かっていることを示唆しています。Search ConsoleがAIからのクリックをまだ教えてくれない現状では、ユーザー自身が複数回チェックを実行し、単一の数値ではなく範囲を報告する責任があります。

解説

この論文が示唆する最も重要な点は、AI可視性ランキングの解釈における統計的な慎重さです。私たちが日々目にするSEOダッシュボードの数字は「固定された事実」ではなく、生成AIの特性上、常に変動する「スナップショット」であるという認識を持つべきでしょう。特に、順位変動や引用シェアの増減を見た際に、それが「本当の変化」なのか、それとも「統計的なノイズ」に過ぎないのかを区別する能力が求められます。単一の測定結果だけでコンテンツ戦略やSEO施策の成否を判断するのは非常に危険です。本研究で提案されている「ランキングが安定していること」と「上位サイト間の差が誤差範囲を超えていること」という2つの条件は、AI可視性データを信頼する上での重要なチェックリストとなります。これらを考慮せず、見た目の順位やシェアだけで一喜一憂することは避けるべきです。また、必要なデータ量がプラットフォームやトピックによって大きく異なるという点は、AI可視性測定予算や時間配分を計画する上で考慮すべき現実的な課題です。例えば、SearchGPTのように各回答がより独立した情報を持つプラットフォームでは、より多くのデータ収集が必要になる可能性があります。レポート作成においては、単一の「きれいな数字」ではなく、「誤差範囲」を伴った情報を提供することが誠実であり、ステークホルダーへの信頼につながります。自社のトラッキングツールがどのようなデータを提供しているかを確認し、可能であれば「十分なデータがない」という正直な回答を出す機能を備えたツールを選ぶことが賢明でしょう。この論文はまだ査読前の段階であり、限定的なデータセットに基づいているため、示された具体的な数値(例:33〜94の回答)をそのまま鵜呑みにするべきではありません。しかし、AI可視性測定の根本的な課題とその解決に向けたアプローチを示しており、今後のAI時代のSEOにおけるデータ分析の方向性を示す重要な洞察と言えます。最終的に、AIの可視性レポートは、より洗練された統計的アプローチと、データの不確実性を明確に伝えるコミュニケーションへと進化していくでしょう。私たちは、その変化に適応し、より堅牢なデータ分析に基づいて意思決定を行う準備をする必要があります。


  • 掲載元: Search engine journal
  • 公開日: 2026-07-11T12:30:19+00:00

AI Visibility Rankings Aren’t Stable – New Research Shows It’s Mostly Statistical Noise via @sejournal, @MattGSouthern