LLMO

AI の計測は何回必要か:n=3 の根拠と限界

同じ質問への AI の回答を 1 回だけ見て判定すると、225 回中 30 回(13%)は、3 回の多数決と逆の結論になっていました。何回測れば何が言えるのか、n=3 の根拠と限界を実測と計算で示します。

この記事の要点

  • 1 回だけの結果は、同じ組の 3 回の多数決と 225 回中 30 回(13%)食い違いました
  • n=3 で言えるのは「揺らいでいるかどうか」という方向感までで、出現率の水準を言うには足りません
  • 精度は、1 問あたりの回数だけでなく「質問数 × 回数」の総数でも決まります

反復回数(n)とは何ですか?

生成 AI の回答は、同じ質問でも回ごとに変わります。そのため、1 つの質問を何回投げるかで、言えることの範囲が変わります。当方は 1 問につき 3 回(n=3)を最小構成にしています。

1 回だけ測ると、どれくらい判断を誤りますか?

実測データで確かめました。

見たもの結果
1 回分の結果(出た/出ない)が、同じ組の 3 回の多数決と食い違った回225 回中 30 回(13%)
3 回とも対象サービスが挙がった組75 組中 33 組(44%)
1〜2 回だけ挙がった組(揺らいでいる組)75 組中 30 組(40%)
1 回も挙がらなかった組75 組中 12 組(16%)

1 回だけ測っていれば、揺らいでいる 30 組(40%)は、どの回を引いたかで「出る」とも「出ない」とも判定されていました。n=3 の最大の役割は、この「揺らいでいる組」を見つけることです。

n=3 で、何が言えて、何が言えないのですか?

言えるのは「揺らいでいるかどうか」という方向感までです。出現率の水準を言うには、回数が足りません。

以下は、観測された割合から、実際の出現率がおおよそどの範囲にあるかを計算したものです(95% の信頼区間・ウィルソンの方法。回答を互いに独立とみなした単純な計算で、実際の幅はこれより広いと考えられます)。

観測観測された割合実際の出現率がありうる範囲
3 回中 2 回67%21%〜94%
5 回中 3 回60%23%〜88%
10 回中 7 回70%40%〜89%
30 回中 20 回67%49%〜81%
225 回中 145 回(上の計測の全体)64%58%〜70%

1 問 3 回の「67%」は、21% から 94% のどこにあってもおかしくない値です。一方で、25 問 × 3 エンジン × 3 回の合計 225 回まで積み上げると、範囲はかなり狭まります。精度は「1 問あたりの回数」だけでなく、「質問数 × 回数」の総数でも決まるということです。

ただし、総数を増やしても揺らぎは消えません。同じ計測を 3 回に分けて集計すると、対象サービスの出現率は 69.3%・64.0%・60.0% と、同じ日のうちに 9 ポイント以上動きました(各回 75 セッション)。

当方は、回数ごとの扱いを次のように分けています。

反復回数言えること使いどころ
n = 1揺らぎについては何も言えない使わない(存在の確認まで)
n = 3方向感(揺らいでいるかどうか)自分で測るときの最小構成。社内の初期共有
n ≧ 5出現率をおおよその水準として扱える継続計測・競合比較
主張根拠の強さ根拠
1 回だけの計測は、3 回の多数決と 1 割以上食い違う◎ 実証当方の実測(225 回中 30 回)
1 問 3 回の出現率は、ありうる範囲が広い◎ 実証上の計算
n ≧ 5 なら、出現率を水準として扱える△ 仮説当方の運用上の目安。統計的な検証はしていない

根拠の強さは、◎ 実証(当方の実測、または複数の独立した調査が同じ結論)/○ 有力/△ 仮説/✕ 否定されつつある、の 4 段階で示しています。

回数を増やす以外に、精度を上げる方法はありますか?

あります。回数だけを増やすより、次の組み合わせのほうが効きます。

方法理由
質問の数を増やす1 問あたりの回数が少なくても、総数が増えれば全体の出現率の幅は狭まる
条件を固定する(文面・時間帯・ログイン状態)条件の違いによる変化を、揺らぎと混ぜない
3 回は続けて投げる日をまたぐと、AI 側の変化が混ざる
エンジンを分けて集計するエンジンごとに揺らぎ方が違う
毎月同じ設計で測る月ごとの差が、揺らぎの範囲を超えているかを判断できる

計測ツールを使う場合は、1 問あたりの回数を設定できるかを確認してください(LLMO ツール比較の前に確認したい 7 項目)。当方の計測規模の例は、無料診断が 8 問 × 3 エンジン × 3 回 = 72 回、初期診断が 50 問 × 5 エンジン × 3 回 = 750 回です。数字をどこまで言い切るかは、この規模に応じて変えています。

月ごとの変化を、揺らぎと施策の効果に分けて読む方法は LLMO の効果検証:モデル交代と施策の効果を分ける にまとめました。

※ 信頼区間は説明のための単純な計算です。

よくある質問

n=3 と n=5、どちらで測るべきですか?

目的によります。自分で現在地を掴むなら n=3 で足ります。競合と比べたり、毎月の変化を追ったりするなら、n=5 以上か、質問数を増やして総数を確保することを勧めます。

3 回を、日を分けて投げてもいいですか?

勧めません。日をまたぐと、AI 側の変化と揺らぎが混ざり、どちらが原因か分からなくなります。3 回は続けて投げ、日を分けた比較は「月ごとの比較」として別に扱ってください。

途中で回数を変えてもいいですか?

変えた前後は、単純には比べられません。回数が違えば、揺らぎの出方も違うためです。変える場合は、変えた時点を記録し、比較のときに注記してください。

計測条件と免責

本ページに記載した数値は、明記した計測条件(エンジン・モデル・反復回数・実施日)のもとで観測された結果です。 生成 AI の回答は継続的に変動するため、同じ条件で再計測しても同一の結果になるとは限らず、将来の結果を保証するものではありません。 また本ページは、特定の施策によって出現率・順位が向上することを保証するものではありません。

法規制に関する記述は、公表されている運用基準にもとづく一般的な整理であり、法的助言ではありません。個別の判断は専門家にご確認ください。

本ページに登場する計測対象・競合は、特に断りのない限り社名を伏せています。特定の企業・サービスを推奨または批判する意図はありません。