実測レポート

AI の回答は毎回違う?同じ質問を 3 回投げた実測

生成 AI に同じ質問を 3 回投げると、ある企業の扱いは「圏外 → 1 位 → 1 位」と変わりました。別の計測では、3 回とも同じ顔ぶれが挙がったのは 75 組中 4 組だけです。回答がどれくらい変わるのかを、計測条件つきで示します。

この記事の要点

  • 同じ質問を同じ条件で 3 回投げると、ある企業の扱いは「圏外 → 1 位 → 1 位」と変わりました
  • 検索をしない AI でも、3 回とも同じ顔ぶれが挙がったのは 75 組中 4 組だけでした
  • AI の答えでの見え方は、1 回の結果ではなく「何回中何回挙がったか(出現率)」で判断します

AI の回答が「毎回違う」とは、どういうことですか?

検索結果は、同じキーワードで調べれば数日単位でほぼ同じ並びが返ってきます。生成 AI の回答は違います。数分のあいだに同じ質問を繰り返すだけで、挙がる社名も順番も変わります。

そのため、AI の回答内での見え方は「出たか、出なかったか」ではなく、「何回中、何回出たか」で表します。

同じ指標を SOV(シェア・オブ・ボイス)と呼ぶこともあります。

検索結果生成 AI の回答
同じ条件で繰り返すと数日単位でほぼ同じ数分のあいだでも変わる
1 回の結果が表すものその時点の順位ありうる回答のうちの 1 つ
見るべき数字順位何回中何回挙がったか(出現率)

同じ質問を 3 回投げると、どれくらい変わりますか?

性質の違う 2 つの計測で確かめました。1 つは Web 検索をしてから答える AI、もう 1 つは検索をせず、学習済みの知識から答える AI です。

検索をする AI に 1 つの質問を 3 回投げると、どうなりましたか?

士業(相続分野)の事務所を探す、社名を含まない質問を 1 問用意し、同じ文面のまま 3 分間で 3 回投げました。

回時刻推薦された数対象社の扱い
1 回目13:524 事務所圏外(名前なし)
2 回目13:535 事務所1 位
3 回目13:545 事務所1 位

対象社の出現率(SOV)は 67%(3 回中 2 回)、出たときの平均順位は 1.0 です。

注目したいのは変わり方です。2 回目と 3 回目は、挙がった 5 事務所も順番もまったく同じでした。一方、1 回目と 2 回目で共通していたのは 1 事務所だけです。回答は少しずつずれるのではなく、まるごと入れ替わることがあります。

3 回を通して名前が挙がった 8 事務所を並べると、次のとおりです(対象社以外は A〜G と表記)。

出現率(SOV)出たときの平均順位
A100%(3/3)1.67
対象社67%(2/3)1.0
B67%(2/3)3.0
C67%(2/3)4.0
D67%(2/3)5.0
E33%(1/3)2.0
F33%(1/3)3.0
G33%(1/3)4.0

8 事務所のうち、3 回とも名前が挙がったのは 1 つだけでした。揺らいでいたのは対象社だけではありません。

検索をしない AI に 25 の質問を 3 回ずつ投げると、どうなりましたか?

もう 1 つは、オンライン英会話の 1 サービスを対象に、社名を含まない質問 25 問を 3 つの AI に 3 回ずつ投げた計測です。質問と AI の組み合わせは 75 組になります。

見たもの結果
3 回とも、挙がった社名の顔ぶれが完全に同じだった組75 組中 4 組(5%)
1 組あたり、3 回のどこかで名前が挙がったサービスの数平均 8.1
1 組あたり、3 回とも名前が挙がったサービスの数平均 2.5

対象サービスについて、75 組を「3 回のうち何回挙がったか」で分けると次のようになりました。

AI3 回とも挙がった1〜2 回だけ1 回も挙がらず
Gemini 2.5 Flash15 組8 組2 組
Claude Sonnet 4.610 組11 組4 組
GPT-4o mini8 組11 組6 組
合計(75 組)33 組(44%)30 組(40%)12 組(16%)

名前が挙がったかどうかは、回答本文を採点用の AI(Gemini 2.5 Flash)で判定しています。

なぜ、AI の回答は毎回変わるのですか?

2 つの計測を並べると、揺らぎには少なくとも 2 つの層があることが分かります。

層何が起きているか実測での現れ方
生成の揺らぎ同じ材料からでも、文章を組み立てるたびに挙げる社名や順番が変わる検索をしない AI でも、75 組中 71 組で顔ぶれが変わった
参照先の入れ替わり検索をする AI は、その回に読んだサイトの組み合わせで答えが変わる対象社のサイトが引用された 2 回は 1 位、引用がなかった 1 回は圏外

1 つ目の層は、自社の側から動かせるものではありません。生成 AI は次に続く言葉を確率にもとづいて選びながら文章を組み立てるため、同じ入力からでも毎回同じ文章になるとは限らないからです。

2 つ目の層は事情が違います。1 回目に AI が根拠として示した 10 件に、対象社のサイトは入っていませんでした。2 回目と 3 回目には入っていて、そのとき対象社は 1 位で挙がっています。どのサイトが参照されたかは、計測で特定できます。ただし 3 回の観測であり、引用と推薦の因果関係を証明したものではありません。連動が観測された、という事実の記述です。

この 3 回で何が違ったのかはAI の回答に登場したのは、引用された回だけだったに、1 回目の 10 件がどんなサイトだったかはAI の引用元、10 件中 8 件は第三者の比較記事だったに書きました。

1 回だけ測ると、何を見誤りますか?

同じ対象から、真逆の結論が出ます。

見た範囲導かれる結論次に取りそうな行動
1 回目だけAI に相手にされていない全面的なやり直し
2 回目だけ1 位を取れている何もしない
3 回とも1 位を取る力はあるが、毎回は出ない出た回と出なかった回の違いを調べる

問題は、結論が割れることではありません。1 回しか測っていなければ、自分がどちらを引いたのかに気づけないことです。

2 つ目の計測に当てはめると、影響の大きさが見えます。対象サービスが「1〜2 回だけ挙がった」30 組(40%)は、1 回しか測っていなければ、どの回を引いたかによって「出る」とも「出ない」とも判定されていました。

出現率だけで判断するのも危険です。1 つ目の計測で、対象社は出現率では A に負けていますが(67% 対 100%)、出たときの平均順位は 1.0 で 8 事務所中もっとも高い。「候補に入る確率」と「入ったときの強さ」は別の数字です。集計の段階で逆の結論が出る落とし穴は、LLMO 効果測定の 5 つの落とし穴:出現率だけでは失敗するにまとめました。

毎回違う回答は、どう測れば判断できますか?

同じ質問を条件を揃えて繰り返し投げ、回数ごとに「どこまで言えるか」を分けて扱います。

反復回数言えること使いどころ
n = 1揺らぎについては何も言えない使わない(存在の確認まで)
n = 3方向感(揺らいでいるかどうか)自分で測るときの最小構成。社内の初期共有
n ≧ 5出現率をおおよその水準として扱える継続計測・競合比較

そのうえで、少なくとも次の 3 つを分けて記録します。

指標計算分かること
出現率(SOV)名前が挙がった回数 ÷ 投げた回数候補に入る確率
出たときの平均順位挙がった回だけで順位を平均挙がったときの推され方の強さ
安定性毎回出る/揺らぐ/出ない再現性があるかどうか

条件の揃え方(間隔・文面・ログイン状態)は、末尾の「よくある質問」にまとめています。

この記事の主張は、どこまで確かですか?

主張根拠の強さ根拠
同じ質問・同じ条件でも、回答に挙がる社名と順位は回ごとに変わる◎ 実証本記事の 2 つの実測
Web 検索をしない AI でも、回答は揺らぐ◎ 実証2 つ目の実測(75 組中 71 組で顔ぶれが変化)
検索をする AI では、引用元の入れ替わりと回答の入れ替わりが連動した◎ 実証(観測の範囲で)1 つ目の実測。3 回の観測で、因果の証明ではない
揺らぎの大きさは AI によって違う△ 仮説2 つ目の実測で差は見えたが、1 分野・1 日の計測。再現は未確認
n ≧ 5 なら出現率を水準として扱える△ 仮説当方の運用上の目安。統計的な検証はしていない

根拠の強さは、◎ 実証(当方の実測、または複数の独立した調査が同じ結論)/○ 有力/△ 仮説/✕ 否定されつつある、の 4 段階で示しています。

よくある質問

3 回測れば十分ですか?

十分ではありません。n=3 で分かるのは「揺らいでいるかどうか」という方向感までです。出現率を水準として扱うなら n≧5 を勧めます。ただし 1 回では揺らいでいるかどうかすら分からないため、まず 3 回測ることに意味があります。回数ごとの根拠と限界は AI の計測は何回必要か:n=3 の根拠と限界 で詳しく扱いました。

3 回は、どれくらいの間隔で投げればいいですか?

続けて投げてください。本記事の計測では、1 つ目は 3 分間、2 つ目は約 30 分間で 3 回を投げ終えています。日をまたぐと、AI 側の変化と自社側の変化が混ざり、どちらが原因か切り分けられなくなります。

質問文を少しずつ変えて投げたほうがいいのではないですか?

反復するときは変えません。文面を一字でも変えると、変化が揺らぎによるものなのか、質問が違うせいなのかを切り分けられなくなります。聞き方の違いを見たい場合は、別の質問として設計し、それぞれを反復してください。

ログインした状態で測ってもいいですか?

勧めません。過去の会話や利用履歴が回答に影響する可能性があります。ログアウトするか、シークレットウィンドウで行い、実施日時・エンジン名・モデル名を毎回記録してください。

自分で測ると、費用はいくらかかりますか?

無料の AI 1 つと表計算ソフトがあれば、費用はかかりません。質問 10 本を 3 回ずつ投げ、所要 60 分ほどでおおよその現在地は掴めます。任せる場合、当方では無料診断(0 円・8 問 × 3 エンジン × 各 3 回)、初期診断 350,000 円(税別)、月次の継続計測と分析 月額 200,000 円(税別)でお受けしています。

計測条件と免責

本ページに記載した数値は、明記した計測条件(エンジン・モデル・反復回数・実施日)のもとで観測された結果です。 生成 AI の回答は継続的に変動するため、同じ条件で再計測しても同一の結果になるとは限らず、将来の結果を保証するものではありません。 また本ページは、特定の施策によって出現率・順位が向上することを保証するものではありません。

法規制に関する記述は、公表されている運用基準にもとづく一般的な整理であり、法的助言ではありません。個別の判断は専門家にご確認ください。

本ページに登場する計測対象・競合は、特に断りのない限り社名を伏せています。特定の企業・サービスを推奨または批判する意図はありません。