LLMO

LLMO 効果測定の 5 つの落とし穴:出現率だけでは失敗する

出現率がほぼ同じ 2 つのサービスの 1 位率を比べると、11.6% と 24.4% で 2 倍以上の差がありました。LLMO の効果測定では、集計の仕方ひとつで逆の結論が出ます。実測データで 5 つの落とし穴を示します。

この記事の要点

  • 出現率がほぼ同じ 2 つのサービスで、1 位率は 11.6% と 24.4% と 2 倍以上違いました
  • 指名質問を混ぜる、出現率だけを見る、登録した競合だけを見る、エンジンをまたいで平均する、モデル交代をまたいで比べる、の 5 つで誤読が起きます
  • 主指標は非指名質問だけで出し、エンジン別に、条件をそろえて比べます

LLMO の効果測定では、何を見るのですか?

測ること自体より難しいのは、読むほうです。計測ツールを選ぶ段階で確かめておきたい点は LLMO ツール比較の前に確認したい 7 項目 にまとめました。当方が実データを集計する中で見つかった落とし穴 4 つと、計測の設計上の注意 1 つをまとめました。

#落とし穴起きること防ぎ方
1指名質問を混ぜたまま平均する質問の型ごとの差が相殺され、それらしい値になる主指標は非指名質問だけで出す
2出現率だけを見る「候補には入るが、最初には挙がらない」が見えない1 位率を並べて見る
3自分で決めた競合だけを見る登録していない強い競合に気づかない回答に挙がった名前を全部拾う
4エンジンをまたいで平均する片方で強く、片方で弱いという事実が消えるエンジン別に出す
5AI 側が変わった期間をまたいで比べる施策の効果と AI 側の変化が区別できないモデル名を毎回記録する

1〜4 は、次の計測のデータで示します。

「名前が挙がった」「1 位」は、回答本文を採点用の AI(Gemini 2.5 Flash)が読み、推薦の対象として挙げられているか、どれを最も優先して勧めているかを判定したものです。

集計のしかたで、どんな誤読が起きますか?

落とし穴 1:指名質問を混ぜたまま平均すると、どうなりますか?

30 問の中には、社名を含む質問が 5 問入っていました。質問の型ごとに対象サービスの出現率(SOV)を分けると、次のとおりです。

質問の型質問数回答数対象サービスの出現率(SOV)
非指名(社名を含まない)2522564.4%
自社指名(対象サービスの評判を聞く)19100%
比較指名(対象サービスと競合を並べて聞く)218100%
競合指名(競合の評判を聞く)2185.6%
全体3027064.1%

全体の 64.1% と非指名の 64.4% は、ほぼ同じ値です。ただしそれは、5.6% と 100% が偶然打ち消し合った結果にすぎません。指名質問の本数や組み合わせが変われば、全体の値は実態と関係なく動きます。

自社名を含む質問では、自社が挙がるのは当然です。競合名を含む質問では、挙がらないのが当然です。主指標は、非指名質問だけで計算してください。指名質問は、評判や誤情報を確かめる用途で別に集計します。

落とし穴 2:出現率だけを見ると、何を見落としますか?

1 位率とは、回答のうち自社が最も優先して推薦された回の割合です。非指名質問の 225 回で比べると、出現率がほぼ同じ 2 つのサービスに、大きな差がありました。

出現率(SOV)1 位率
対象サービス64.4%11.6%
競合 263.6%24.4%

出現率の差は 0.8 ポイントしかないのに、1 位率は 2 倍以上違います。「候補には入るが、最初には挙げられない」という状態は、出現率だけを見ている限り表に出ません。

比べる相手と比べ方で、どんな誤読が起きますか?

落とし穴 3:自分で決めた競合だけを見ると、何を見落としますか?

この計測で、事前に登録していた競合は 3 つでした。ところが回答に実際に挙がったサービスを全部拾うと、登録していなかったサービスの 1 つが、1 位率 14.2% で対象サービス(11.6%)を上回っていました。何を見落としていたかの詳細は、LLMO の競合分析:登録した競合の外に何がいるか に書きました。

落とし穴 4:エンジンをまたいで平均すると、何が消えますか?

非指名質問の結果を、エンジン別に分けます(各 75 回)。

Gemini 2.5 FlashClaude Sonnet 4.6GPT-4o mini3 つの平均
対象サービスの出現率(SOV)76.0%61.3%56.0%64.4%
対象サービスの 1 位率6.7%10.7%17.3%11.6%
競合 3 の出現率(SOV)49.3%33.3%6.7%29.8%

平均だけを見ると、2 つの事実が消えます。

  • 対象サービスは、最も名前が挙がる AI で、最も 1 位になりにくい
  • 競合 3 は、ある AI ではほとんど挙がらない

どの AI で、どう負けているかが分からなければ、打ち手の優先順位も決められません。エンジンは必ず分けて報告してください。なお、Web 検索をする AI としない AI では、答えの作り方そのものが違います(検索しない AI からは、引用元を取得できない)。

時間をまたいで比べるとき、何に気をつけますか?

落とし穴 5:AI 側が変わった期間をまたいで比べると、どうなりますか?

効果測定は「施策の前と後」を比べる作業です。ところがその間に、AI 側のモデルが入れ替わることがあります。そうなると、数字が動いた原因が自社の施策なのか、AI 側の変化なのかを切り分けられません。

当方はまだ、モデルの交代をまたいだ前後比較を、公開できる形では持っていません。ここは実測ではなく、計測設計上の注意として書いています。

それを踏まえた、測り方と言い方の原則です。

やること理由
計測日・エンジン名・モデル名を毎回記録する比べてよい計測同士かを、あとで判定するため
質問の文面と本数を固定する質問が変わると、前後比較が成立しない
変化は事実として書く(「X% から Y% に変化した」)施策以外の変数が多く、因果は断定できない
同じ回数(n)で比べる回数が違うと、揺らぎの大きさが違う(AI の回答は毎回違う?同じ質問を 3 回投げた実測)

この記事の主張を、根拠の強さとあわせて整理します。

主張根拠の強さ根拠
質問の型を分けずに集計すると、実態と関係なく値が動く◎ 実証本記事の実測(落とし穴 1)
出現率が同じでも、1 位率は大きく違いうる◎ 実証本記事の実測(落とし穴 2)
エンジンによって見え方は大きく違う◎ 実証本記事の実測(1 分野・1 日)
施策の前後で数字が動けば、施策が効いたと言える✕ 否定されつつあるAI 側の変化や回答の揺らぎと区別できない(LLMO の効果検証:モデル交代と施策の効果を分ける)
施策の効果が表れるまでは 1〜3 か月△ 仮説よく言われる目安だが、根拠は経験則

根拠の強さは、◎ 実証(当方の実測、または複数の独立した調査が同じ結論)/○ 有力/△ 仮説/✕ 否定されつつある、の 4 段階で示しています。

よくある質問

効果測定は、どれくらいの頻度で行えばいいですか?

月 1 回、同じ質問・同じエンジン・同じ回数で測るのが基本です。間隔を短くしても、AI の回答は揺らぐため、施策と関係のない変化を拾うだけになりがちです。

出現率が上がったら、施策が効いたと言えますか?

言えません。言えるのは「施策後の計測で、出現率が X% から Y% に変化した」という事実までです。AI 側のモデルの交代や回答の揺らぎなど、施策以外にも数字を動かす要因が多すぎるためです。

指名質問は、測らなくていいのですか?

測る価値はあります。自社名で聞かれたときに誤った情報や否定的な評判が出ていないかは、指名質問でしか確かめられません。ただし出現率の主指標とは混ぜず、別に集計してください。

社内に報告するとき、最低限そろえるべきものは何ですか?

母数、質問の型、エンジン、反復回数、実施日の 5 つです。この 5 つが添えられていない数字は、あとから検証も比較もできません。

計測条件と免責

本ページに記載した数値は、明記した計測条件(エンジン・モデル・反復回数・実施日)のもとで観測された結果です。 生成 AI の回答は継続的に変動するため、同じ条件で再計測しても同一の結果になるとは限らず、将来の結果を保証するものではありません。 また本ページは、特定の施策によって出現率・順位が向上することを保証するものではありません。

法規制に関する記述は、公表されている運用基準にもとづく一般的な整理であり、法的助言ではありません。個別の判断は専門家にご確認ください。

本ページに登場する計測対象・競合は、特に断りのない限り社名を伏せています。特定の企業・サービスを推奨または批判する意図はありません。