この記事の要点
- 同じ質問を同じ条件で 3 回投げると、ある企業の扱いは「圏外 → 1 位 → 1 位」と変わりました
- 検索をしない AI でも、3 回とも同じ顔ぶれが挙がったのは 75 組中 4 組だけでした
- AI の答えでの見え方は、1 回の結果ではなく「何回中何回挙がったか(出現率)」で判断します
AI の回答が「毎回違う」とは、どういうことですか?
検索結果は、同じキーワードで調べれば数日単位でほぼ同じ並びが返ってきます。生成 AI の回答は違います。数分のあいだに同じ質問を繰り返すだけで、挙がる社名も順番も変わります。
そのため、AI の回答内での見え方は「出たか、出なかったか」ではなく、「何回中、何回出たか」で表します。
同じ指標を SOV(シェア・オブ・ボイス)と呼ぶこともあります。
| 検索結果 | 生成 AI の回答 | |
|---|---|---|
| 同じ条件で繰り返すと | 数日単位でほぼ同じ | 数分のあいだでも変わる |
| 1 回の結果が表すもの | その時点の順位 | ありうる回答のうちの 1 つ |
| 見るべき数字 | 順位 | 何回中何回挙がったか(出現率) |
同じ質問を 3 回投げると、どれくらい変わりますか?
性質の違う 2 つの計測で確かめました。1 つは Web 検索をしてから答える AI、もう 1 つは検索をせず、学習済みの知識から答える AI です。
検索をする AI に 1 つの質問を 3 回投げると、どうなりましたか?
士業(相続分野)の事務所を探す、社名を含まない質問を 1 問用意し、同じ文面のまま 3 分間で 3 回投げました。
| 回 | 時刻 | 推薦された数 | 対象社の扱い |
|---|---|---|---|
| 1 回目 | 13:52 | 4 事務所 | 圏外(名前なし) |
| 2 回目 | 13:53 | 5 事務所 | 1 位 |
| 3 回目 | 13:54 | 5 事務所 | 1 位 |
対象社の出現率(SOV)は 67%(3 回中 2 回)、出たときの平均順位は 1.0 です。
注目したいのは変わり方です。2 回目と 3 回目は、挙がった 5 事務所も順番もまったく同じでした。一方、1 回目と 2 回目で共通していたのは 1 事務所だけです。回答は少しずつずれるのではなく、まるごと入れ替わることがあります。
3 回を通して名前が挙がった 8 事務所を並べると、次のとおりです(対象社以外は A〜G と表記)。
| 出現率(SOV) | 出たときの平均順位 | |
|---|---|---|
| A | 100%(3/3) | 1.67 |
| 対象社 | 67%(2/3) | 1.0 |
| B | 67%(2/3) | 3.0 |
| C | 67%(2/3) | 4.0 |
| D | 67%(2/3) | 5.0 |
| E | 33%(1/3) | 2.0 |
| F | 33%(1/3) | 3.0 |
| G | 33%(1/3) | 4.0 |
8 事務所のうち、3 回とも名前が挙がったのは 1 つだけでした。揺らいでいたのは対象社だけではありません。
検索をしない AI に 25 の質問を 3 回ずつ投げると、どうなりましたか?
もう 1 つは、オンライン英会話の 1 サービスを対象に、社名を含まない質問 25 問を 3 つの AI に 3 回ずつ投げた計測です。質問と AI の組み合わせは 75 組になります。
| 見たもの | 結果 |
|---|---|
| 3 回とも、挙がった社名の顔ぶれが完全に同じだった組 | 75 組中 4 組(5%) |
| 1 組あたり、3 回のどこかで名前が挙がったサービスの数 | 平均 8.1 |
| 1 組あたり、3 回とも名前が挙がったサービスの数 | 平均 2.5 |
対象サービスについて、75 組を「3 回のうち何回挙がったか」で分けると次のようになりました。
| AI | 3 回とも挙がった | 1〜2 回だけ | 1 回も挙がらず |
|---|---|---|---|
| Gemini 2.5 Flash | 15 組 | 8 組 | 2 組 |
| Claude Sonnet 4.6 | 10 組 | 11 組 | 4 組 |
| GPT-4o mini | 8 組 | 11 組 | 6 組 |
| 合計(75 組) | 33 組(44%) | 30 組(40%) | 12 組(16%) |
名前が挙がったかどうかは、回答本文を採点用の AI(Gemini 2.5 Flash)で判定しています。
なぜ、AI の回答は毎回変わるのですか?
2 つの計測を並べると、揺らぎには少なくとも 2 つの層があることが分かります。
| 層 | 何が起きているか | 実測での現れ方 |
|---|---|---|
| 生成の揺らぎ | 同じ材料からでも、文章を組み立てるたびに挙げる社名や順番が変わる | 検索をしない AI でも、75 組中 71 組で顔ぶれが変わった |
| 参照先の入れ替わり | 検索をする AI は、その回に読んだサイトの組み合わせで答えが変わる | 対象社のサイトが引用された 2 回は 1 位、引用がなかった 1 回は圏外 |
1 つ目の層は、自社の側から動かせるものではありません。生成 AI は次に続く言葉を確率にもとづいて選びながら文章を組み立てるため、同じ入力からでも毎回同じ文章になるとは限らないからです。
2 つ目の層は事情が違います。1 回目に AI が根拠として示した 10 件に、対象社のサイトは入っていませんでした。2 回目と 3 回目には入っていて、そのとき対象社は 1 位で挙がっています。どのサイトが参照されたかは、計測で特定できます。ただし 3 回の観測であり、引用と推薦の因果関係を証明したものではありません。連動が観測された、という事実の記述です。
この 3 回で何が違ったのかはAI の回答に登場したのは、引用された回だけだったに、1 回目の 10 件がどんなサイトだったかはAI の引用元、10 件中 8 件は第三者の比較記事だったに書きました。
1 回だけ測ると、何を見誤りますか?
同じ対象から、真逆の結論が出ます。
| 見た範囲 | 導かれる結論 | 次に取りそうな行動 |
|---|---|---|
| 1 回目だけ | AI に相手にされていない | 全面的なやり直し |
| 2 回目だけ | 1 位を取れている | 何もしない |
| 3 回とも | 1 位を取る力はあるが、毎回は出ない | 出た回と出なかった回の違いを調べる |
問題は、結論が割れることではありません。1 回しか測っていなければ、自分がどちらを引いたのかに気づけないことです。
2 つ目の計測に当てはめると、影響の大きさが見えます。対象サービスが「1〜2 回だけ挙がった」30 組(40%)は、1 回しか測っていなければ、どの回を引いたかによって「出る」とも「出ない」とも判定されていました。
出現率だけで判断するのも危険です。1 つ目の計測で、対象社は出現率では A に負けていますが(67% 対 100%)、出たときの平均順位は 1.0 で 8 事務所中もっとも高い。「候補に入る確率」と「入ったときの強さ」は別の数字です。集計の段階で逆の結論が出る落とし穴は、LLMO 効果測定の 5 つの落とし穴:出現率だけでは失敗するにまとめました。
毎回違う回答は、どう測れば判断できますか?
同じ質問を条件を揃えて繰り返し投げ、回数ごとに「どこまで言えるか」を分けて扱います。
| 反復回数 | 言えること | 使いどころ |
|---|---|---|
| n = 1 | 揺らぎについては何も言えない | 使わない(存在の確認まで) |
| n = 3 | 方向感(揺らいでいるかどうか) | 自分で測るときの最小構成。社内の初期共有 |
| n ≧ 5 | 出現率をおおよその水準として扱える | 継続計測・競合比較 |
そのうえで、少なくとも次の 3 つを分けて記録します。
| 指標 | 計算 | 分かること |
|---|---|---|
| 出現率(SOV) | 名前が挙がった回数 ÷ 投げた回数 | 候補に入る確率 |
| 出たときの平均順位 | 挙がった回だけで順位を平均 | 挙がったときの推され方の強さ |
| 安定性 | 毎回出る/揺らぐ/出ない | 再現性があるかどうか |
条件の揃え方(間隔・文面・ログイン状態)は、末尾の「よくある質問」にまとめています。
この記事の主張は、どこまで確かですか?
| 主張 | 根拠の強さ | 根拠 |
|---|---|---|
| 同じ質問・同じ条件でも、回答に挙がる社名と順位は回ごとに変わる | ◎ 実証 | 本記事の 2 つの実測 |
| Web 検索をしない AI でも、回答は揺らぐ | ◎ 実証 | 2 つ目の実測(75 組中 71 組で顔ぶれが変化) |
| 検索をする AI では、引用元の入れ替わりと回答の入れ替わりが連動した | ◎ 実証(観測の範囲で) | 1 つ目の実測。3 回の観測で、因果の証明ではない |
| 揺らぎの大きさは AI によって違う | △ 仮説 | 2 つ目の実測で差は見えたが、1 分野・1 日の計測。再現は未確認 |
| n ≧ 5 なら出現率を水準として扱える | △ 仮説 | 当方の運用上の目安。統計的な検証はしていない |
根拠の強さは、◎ 実証(当方の実測、または複数の独立した調査が同じ結論)/○ 有力/△ 仮説/✕ 否定されつつある、の 4 段階で示しています。