この記事の要点
- 同じ「出現率」でも、数え方が違えば値も意味も変わります
- ツールを比べる前に、反復回数・「出現」の定義・未生成の扱い・検索をする AI・原文・登録外の競合・計測条件の 7 項目を確かめます
- Google と Microsoft の無料のレポートで分かる範囲と、ツールで補う範囲を分けて考えると整理しやすくなります
LLMO ツールを比べるとき、何を見ればいいのですか?
料金や画面の見やすさは比べやすい項目です。けれども、同じ「出現率」という名前の数字でも、数え方が違えば値も意味も変わります。比べる前に、数字の出し方と、見えるものの範囲を確かめておく必要があります。
この記事では、特定の製品名は挙げません。どのツールを検討する場合にも使える、確認項目だけを書きます。7 項目の全体は次のとおりです。
| # | 確認項目 | 確かめないと起きること |
|---|---|---|
| 1 | 同じ質問を何回投げるか(反復回数)を設定できるか | たまたまの結果を実力と読む |
| 2 | 「出現」の定義と、指名/非指名の分け方が明示されているか | 数字の意味が分からない。値が実態と関係なく動く |
| 3 | 「AI が答えなかった回」を「圏外」と区別できるか | 実力を低く見積もる |
| 4 | Web 検索をする AI を計測に含められるか | 根拠のサイトが分からず、打ち手が決まらない |
| 5 | 回答の全文を保存し、あとから原文を読めるか | 数字の理由を確かめられない |
| 6 | 登録していない競合も回答から拾えるか(名寄せを含む) | 強い競合を見落とす |
| 7 | 計測条件を記録し、条件の違う計測の比較に注意を促せるか | 施策の効果と AI 側の変化を取り違える |
以下、根拠とあわせて説明します。数字はいずれも当方の実測です。
数字の出し方について、何を確かめればいいですか?
1. 反復回数を設定できるか。1 回だけの結果(出た/出ない)は、同じ質問の 3 回の多数決と、225 回中 30 回(13%)食い違いました。1 問 1 回しか投げない設計では、揺らいでいる質問を見つけられません(AI の計測は何回必要か:n=3 の根拠と限界)。
2.「出現」の定義と、指名/非指名の分け方。同じデータでも、「回答のどこかで言及された」を数えると 65.6%、「推薦の対象として挙げられた」を数えると 64.1% でした。さらに、社名を含む質問を混ぜると、競合名入りの質問では 5.6%、自社名入りでは 100% と極端な値が混ざります。ツールの出現率が何を数えた値なのか、質問の型を分けて集計できるかを確認してください。
3.「答えなかった回」を区別できるか。Google の AI 概要のように、質問によっては回答そのものが生成されない AI があります。その回を「圏外」と同じ 0 として数えると、出現率が実際より低く出ます。
見えるものの範囲について、何を確かめればいいですか?
4. Web 検索をする AI を含められるか。Web 検索をしない AI に 270 回質問したところ、根拠として参照したページを示した回答は 0 件でした。引用元が返らない AI だけを測るツールでは、「どこに載れば回答が変わりうるか」という手がかりが得られません(ChatGPT・Gemini で LLMO の打ち手は違うのか)。
5. 回答の全文を読めるか。「引用はされているのに推薦されていない」「名前は挙がったが否定的に書かれている」といった状態は、集計の数字には表れず、原文を読んで初めて分かります。数字から原文に戻れるかを確認してください。
6. 登録していない競合を拾えるか。競合 3 つを登録して測ったところ、社名を含まない質問の回答の 94% に登録外のサービスが挙がり、そのうち 1 つは 1 位率で対象サービスを上回っていました。また、自動で抜き出した名前には表記ゆれが多く含まれ、対象サービスの名前が英字で書かれた回は別のサービスとして数えられていました。拾えるかどうかに加えて、名寄せの仕組みがあるかも確認してください。
| 確認するとよい質問 | 見るポイント |
|---|---|
| 「出現」とは何を数えた値ですか | 言及か、推薦か。否定的な言及を含むか |
| 質問ごとに何回投げていますか | 1 回か、複数回か。回数を変えられるか |
| どの AI を、Web 検索ありで測っていますか | 引用元が返る AI が含まれるか |
| 回答の原文は見られますか | 集計から原文に戻れるか |
| 登録外の競合はどう扱いますか | 自動で拾えるか。表記ゆれをまとめられるか |
なお、Google の Search Console(生成 AI のレポート)と Microsoft の Bing Webmaster Tools(AI Performance)でも、AI の機能の中で自社サイトが表示・引用された数を無料で見られるようになりました(2026 年)。どちらも、答えの中で勧められたかまでは分かりません。ツールを選ぶときは、公式の無料の数字では足りない部分を何で補うかを基準にすると整理しやすくなります(Search Console の生成 AI レポートで分かること)。
比較の正しさについて、何を確かめればいいですか?
7. 計測条件を記録し、比較に注意を促せるか。同じ計測を 3 回に分けて集計すると、対象サービスの出現率は、何も変えていないのに 69.3%・64.0%・60.0% と動きました。さらに月をまたぐと、AI 側のモデルが入れ替わることもあります。
実施日時、エンジン名、モデル名、検索の地域、質問の文面が回ごとに記録され、条件の違う計測を比べようとしたときに気づける仕組みがあるかを確認してください。条件を記録していないツールで「先月より上がった」と言われても、それが施策の効果なのか、AI 側の変化なのかは判断できません(LLMO 効果測定の 5 つの落とし穴:出現率だけでは失敗する)。
| 主張 | 根拠の強さ | 根拠 |
|---|---|---|
| 1 回だけの計測は、3 回の多数決と 1 割以上食い違う | ◎ 実証 | 当方の実測(225 回中 30 回) |
| 「出現」の定義で、同じデータの出現率が変わる | ◎ 実証 | 当方の実測(65.6% と 64.1%) |
| Web 検索をしない AI は、根拠を示さない | ◎ 実証 | 当方の実測(270 回で 0 件) |
| 登録外の競合が、1 位率で自社を上回ることがある | ◎ 実証 | 当方の実測(1 分野・1 日) |
| 何も変えなくても、出現率は同じ日のうちに数ポイント動く | ◎ 実証 | 当方の実測(69.3%・64.0%・60.0%) |
根拠の強さは、◎ 実証(当方の実測、または複数の独立した調査が同じ結論)/○ 有力/△ 仮説/✕ 否定されつつある、の 4 段階で示しています。