調査仕様
このログの数字が、どの条件で作られているか
対象カテゴリ
| 分野 | Amazon ビューティー |
| 階層 | 大カテゴリ(ビューティー)› 中カテゴリ 10 › 小カテゴリ 88(重複4語を除き84件を測定) |
| 質問単位 | 小カテゴリ名。中カテゴリ名を付けないと意味が定まらない7件は中カテゴリ名を前置 |
| 取得日 | 2026年8月(Amazon ベストセラーページのカテゴリ名を手作業で採取) |
質問
| 質問文 | 「おすすめの{カテゴリ名}は?」(全カテゴリ同一テンプレート) |
| 回答形式 | 商品名・順位・一言説明を構造化出力で取得。分からない場合は空の回答を許容 |
| 試行回数 | 各カテゴリ×各LLMにつき10回。並列5で実行 |
LLM
| GPT | ChatGPT無料版のデフォルトモデル(API名 gpt-5.6-luna)。推論モードなし |
| Claude | Claude Sonnet 5(API名 claude-sonnet-5) |
| 設定 | temperature・top_p・top_k はいずれも指定せず、各社のデフォルトのまま。利用者が実際に接する条件を優先 |
| 記録 | 応答に含まれる実モデル名を測定ごとに保存 |
想起集合の強度
| 定義 | 10回の回答に出た商品の顔ぶれの一致度。回答同士の集合の重なり(Jaccard係数)を全組み合わせで平均し、上位順位の一致を重み付けした指標を併用 |
| 4段階 | 盤石 0.86以上 / 強固 0.70以上 / 中程度 0.40以上 / 不安定 0.40未満 |
| 閾値の根拠 | 0.70/0.40はディギディギの判定値を踏襲。0.86は先行するビールカテゴリの実測で、共起を増やしても強度が動かなかった下限 |
| 想起なし | 10回すべてで商品名が出なかった場合。強度は算出せず「想起なし」と表示 |
| 名寄せ | 同一LLMの10回の回答内で表記ゆれを統合。GPTとClaudeの間では統合しない(両者の表記の違いをそのまま表示) |
RAG発火率
| 定義 | RAG(AI検索)を使える状態で同じ質問を10回行い、LLMがRAGを呼んだ回数 ÷ 10 |
| 条件 | 強度測定とは別に実施。RAGの使用可否はLLM自身の判断に委ね、強制しない |
| RAG依存 | 発火率 8/10 以上を「RAG依存」と表示 |
| 注意 | API経由の測定であり、ChatGPT・Claudeのアプリ画面での検索挙動と同一とは限らない |
更新と表示
| 更新 | 新しいモデルが公開された時点で再測定。ページは常に最新の測定結果を表示 |
| 解説 | 「ディギコの解説」は測定データのみを素材にLLM(Claude Haiku)が生成した文章に、強度と発火率の組み合わせで決まる定型文を付加したもの |
| 商品の説明文 | LLMの回答をそのまま掲載。事実と異なる場合があり、正誤の検証は行っていない |
| 評価 | 商品の性能・品質の評価・推奨は行わない |
運営
| 運営 | 株式会社トドオナダ(東京都台東区) |
| 測定ツール | ディギディギ(LLM想起集合測定ツール)の測定基盤を使用 |
| お問い合わせ | 広報担当 白石(shiraishi@todo-o-nada.com) |
自社ブランドはLLMの想起集合に入っていますか?ディギディギなら、任意のカテゴリ・任意のモデルで想起集合の強度とハルシネーションを測定できます。
ディギディギを見る