この記事の要点
- 1 回だけの結果は、同じ組の 3 回の多数決と 225 回中 30 回(13%)食い違いました
- n=3 で言えるのは「揺らいでいるかどうか」という方向感までで、出現率の水準を言うには足りません
- 精度は、1 問あたりの回数だけでなく「質問数 × 回数」の総数でも決まります
反復回数(n)とは何ですか?
生成 AI の回答は、同じ質問でも回ごとに変わります。そのため、1 つの質問を何回投げるかで、言えることの範囲が変わります。当方は 1 問につき 3 回(n=3)を最小構成にしています。
1 回だけ測ると、どれくらい判断を誤りますか?
実測データで確かめました。
| 見たもの | 結果 |
|---|---|
| 1 回分の結果(出た/出ない)が、同じ組の 3 回の多数決と食い違った回 | 225 回中 30 回(13%) |
| 3 回とも対象サービスが挙がった組 | 75 組中 33 組(44%) |
| 1〜2 回だけ挙がった組(揺らいでいる組) | 75 組中 30 組(40%) |
| 1 回も挙がらなかった組 | 75 組中 12 組(16%) |
1 回だけ測っていれば、揺らいでいる 30 組(40%)は、どの回を引いたかで「出る」とも「出ない」とも判定されていました。n=3 の最大の役割は、この「揺らいでいる組」を見つけることです。
n=3 で、何が言えて、何が言えないのですか?
言えるのは「揺らいでいるかどうか」という方向感までです。出現率の水準を言うには、回数が足りません。
以下は、観測された割合から、実際の出現率がおおよそどの範囲にあるかを計算したものです(95% の信頼区間・ウィルソンの方法。回答を互いに独立とみなした単純な計算で、実際の幅はこれより広いと考えられます)。
| 観測 | 観測された割合 | 実際の出現率がありうる範囲 |
|---|---|---|
| 3 回中 2 回 | 67% | 21%〜94% |
| 5 回中 3 回 | 60% | 23%〜88% |
| 10 回中 7 回 | 70% | 40%〜89% |
| 30 回中 20 回 | 67% | 49%〜81% |
| 225 回中 145 回(上の計測の全体) | 64% | 58%〜70% |
1 問 3 回の「67%」は、21% から 94% のどこにあってもおかしくない値です。一方で、25 問 × 3 エンジン × 3 回の合計 225 回まで積み上げると、範囲はかなり狭まります。精度は「1 問あたりの回数」だけでなく、「質問数 × 回数」の総数でも決まるということです。
ただし、総数を増やしても揺らぎは消えません。同じ計測を 3 回に分けて集計すると、対象サービスの出現率は 69.3%・64.0%・60.0% と、同じ日のうちに 9 ポイント以上動きました(各回 75 セッション)。
当方は、回数ごとの扱いを次のように分けています。
| 反復回数 | 言えること | 使いどころ |
|---|---|---|
| n = 1 | 揺らぎについては何も言えない | 使わない(存在の確認まで) |
| n = 3 | 方向感(揺らいでいるかどうか) | 自分で測るときの最小構成。社内の初期共有 |
| n ≧ 5 | 出現率をおおよその水準として扱える | 継続計測・競合比較 |
| 主張 | 根拠の強さ | 根拠 |
|---|---|---|
| 1 回だけの計測は、3 回の多数決と 1 割以上食い違う | ◎ 実証 | 当方の実測(225 回中 30 回) |
| 1 問 3 回の出現率は、ありうる範囲が広い | ◎ 実証 | 上の計算 |
| n ≧ 5 なら、出現率を水準として扱える | △ 仮説 | 当方の運用上の目安。統計的な検証はしていない |
根拠の強さは、◎ 実証(当方の実測、または複数の独立した調査が同じ結論)/○ 有力/△ 仮説/✕ 否定されつつある、の 4 段階で示しています。
回数を増やす以外に、精度を上げる方法はありますか?
あります。回数だけを増やすより、次の組み合わせのほうが効きます。
| 方法 | 理由 |
|---|---|
| 質問の数を増やす | 1 問あたりの回数が少なくても、総数が増えれば全体の出現率の幅は狭まる |
| 条件を固定する(文面・時間帯・ログイン状態) | 条件の違いによる変化を、揺らぎと混ぜない |
| 3 回は続けて投げる | 日をまたぐと、AI 側の変化が混ざる |
| エンジンを分けて集計する | エンジンごとに揺らぎ方が違う |
| 毎月同じ設計で測る | 月ごとの差が、揺らぎの範囲を超えているかを判断できる |
計測ツールを使う場合は、1 問あたりの回数を設定できるかを確認してください(LLMO ツール比較の前に確認したい 7 項目)。当方の計測規模の例は、無料診断が 8 問 × 3 エンジン × 3 回 = 72 回、初期診断が 50 問 × 5 エンジン × 3 回 = 750 回です。数字をどこまで言い切るかは、この規模に応じて変えています。
月ごとの変化を、揺らぎと施策の効果に分けて読む方法は LLMO の効果検証:モデル交代と施策の効果を分ける にまとめました。
※ 信頼区間は説明のための単純な計算です。