この記事の要点
- 出現率がほぼ同じ 2 つのサービスで、1 位率は 11.6% と 24.4% と 2 倍以上違いました
- 指名質問を混ぜる、出現率だけを見る、登録した競合だけを見る、エンジンをまたいで平均する、モデル交代をまたいで比べる、の 5 つで誤読が起きます
- 主指標は非指名質問だけで出し、エンジン別に、条件をそろえて比べます
LLMO の効果測定では、何を見るのですか?
測ること自体より難しいのは、読むほうです。計測ツールを選ぶ段階で確かめておきたい点は LLMO ツール比較の前に確認したい 7 項目 にまとめました。当方が実データを集計する中で見つかった落とし穴 4 つと、計測の設計上の注意 1 つをまとめました。
| # | 落とし穴 | 起きること | 防ぎ方 |
|---|---|---|---|
| 1 | 指名質問を混ぜたまま平均する | 質問の型ごとの差が相殺され、それらしい値になる | 主指標は非指名質問だけで出す |
| 2 | 出現率だけを見る | 「候補には入るが、最初には挙がらない」が見えない | 1 位率を並べて見る |
| 3 | 自分で決めた競合だけを見る | 登録していない強い競合に気づかない | 回答に挙がった名前を全部拾う |
| 4 | エンジンをまたいで平均する | 片方で強く、片方で弱いという事実が消える | エンジン別に出す |
| 5 | AI 側が変わった期間をまたいで比べる | 施策の効果と AI 側の変化が区別できない | モデル名を毎回記録する |
1〜4 は、次の計測のデータで示します。
「名前が挙がった」「1 位」は、回答本文を採点用の AI(Gemini 2.5 Flash)が読み、推薦の対象として挙げられているか、どれを最も優先して勧めているかを判定したものです。
集計のしかたで、どんな誤読が起きますか?
落とし穴 1:指名質問を混ぜたまま平均すると、どうなりますか?
30 問の中には、社名を含む質問が 5 問入っていました。質問の型ごとに対象サービスの出現率(SOV)を分けると、次のとおりです。
| 質問の型 | 質問数 | 回答数 | 対象サービスの出現率(SOV) |
|---|---|---|---|
| 非指名(社名を含まない) | 25 | 225 | 64.4% |
| 自社指名(対象サービスの評判を聞く) | 1 | 9 | 100% |
| 比較指名(対象サービスと競合を並べて聞く) | 2 | 18 | 100% |
| 競合指名(競合の評判を聞く) | 2 | 18 | 5.6% |
| 全体 | 30 | 270 | 64.1% |
全体の 64.1% と非指名の 64.4% は、ほぼ同じ値です。ただしそれは、5.6% と 100% が偶然打ち消し合った結果にすぎません。指名質問の本数や組み合わせが変われば、全体の値は実態と関係なく動きます。
自社名を含む質問では、自社が挙がるのは当然です。競合名を含む質問では、挙がらないのが当然です。主指標は、非指名質問だけで計算してください。指名質問は、評判や誤情報を確かめる用途で別に集計します。
落とし穴 2:出現率だけを見ると、何を見落としますか?
1 位率とは、回答のうち自社が最も優先して推薦された回の割合です。非指名質問の 225 回で比べると、出現率がほぼ同じ 2 つのサービスに、大きな差がありました。
| 出現率(SOV) | 1 位率 | |
|---|---|---|
| 対象サービス | 64.4% | 11.6% |
| 競合 2 | 63.6% | 24.4% |
出現率の差は 0.8 ポイントしかないのに、1 位率は 2 倍以上違います。「候補には入るが、最初には挙げられない」という状態は、出現率だけを見ている限り表に出ません。
比べる相手と比べ方で、どんな誤読が起きますか?
落とし穴 3:自分で決めた競合だけを見ると、何を見落としますか?
この計測で、事前に登録していた競合は 3 つでした。ところが回答に実際に挙がったサービスを全部拾うと、登録していなかったサービスの 1 つが、1 位率 14.2% で対象サービス(11.6%)を上回っていました。何を見落としていたかの詳細は、LLMO の競合分析:登録した競合の外に何がいるか に書きました。
落とし穴 4:エンジンをまたいで平均すると、何が消えますか?
非指名質問の結果を、エンジン別に分けます(各 75 回)。
| Gemini 2.5 Flash | Claude Sonnet 4.6 | GPT-4o mini | 3 つの平均 | |
|---|---|---|---|---|
| 対象サービスの出現率(SOV) | 76.0% | 61.3% | 56.0% | 64.4% |
| 対象サービスの 1 位率 | 6.7% | 10.7% | 17.3% | 11.6% |
| 競合 3 の出現率(SOV) | 49.3% | 33.3% | 6.7% | 29.8% |
平均だけを見ると、2 つの事実が消えます。
- 対象サービスは、最も名前が挙がる AI で、最も 1 位になりにくい
- 競合 3 は、ある AI ではほとんど挙がらない
どの AI で、どう負けているかが分からなければ、打ち手の優先順位も決められません。エンジンは必ず分けて報告してください。なお、Web 検索をする AI としない AI では、答えの作り方そのものが違います(検索しない AI からは、引用元を取得できない)。
時間をまたいで比べるとき、何に気をつけますか?
落とし穴 5:AI 側が変わった期間をまたいで比べると、どうなりますか?
効果測定は「施策の前と後」を比べる作業です。ところがその間に、AI 側のモデルが入れ替わることがあります。そうなると、数字が動いた原因が自社の施策なのか、AI 側の変化なのかを切り分けられません。
当方はまだ、モデルの交代をまたいだ前後比較を、公開できる形では持っていません。ここは実測ではなく、計測設計上の注意として書いています。
それを踏まえた、測り方と言い方の原則です。
| やること | 理由 |
|---|---|
| 計測日・エンジン名・モデル名を毎回記録する | 比べてよい計測同士かを、あとで判定するため |
| 質問の文面と本数を固定する | 質問が変わると、前後比較が成立しない |
| 変化は事実として書く(「X% から Y% に変化した」) | 施策以外の変数が多く、因果は断定できない |
| 同じ回数(n)で比べる | 回数が違うと、揺らぎの大きさが違う(AI の回答は毎回違う?同じ質問を 3 回投げた実測) |
この記事の主張を、根拠の強さとあわせて整理します。
| 主張 | 根拠の強さ | 根拠 |
|---|---|---|
| 質問の型を分けずに集計すると、実態と関係なく値が動く | ◎ 実証 | 本記事の実測(落とし穴 1) |
| 出現率が同じでも、1 位率は大きく違いうる | ◎ 実証 | 本記事の実測(落とし穴 2) |
| エンジンによって見え方は大きく違う | ◎ 実証 | 本記事の実測(1 分野・1 日) |
| 施策の前後で数字が動けば、施策が効いたと言える | ✕ 否定されつつある | AI 側の変化や回答の揺らぎと区別できない(LLMO の効果検証:モデル交代と施策の効果を分ける) |
| 施策の効果が表れるまでは 1〜3 か月 | △ 仮説 | よく言われる目安だが、根拠は経験則 |
根拠の強さは、◎ 実証(当方の実測、または複数の独立した調査が同じ結論)/○ 有力/△ 仮説/✕ 否定されつつある、の 4 段階で示しています。