ディギコのチャピりログは、ChatGPTとClaudeの無料LLMにビューティー分野のカテゴリ質問を各10回行い、LLMが想起した商品と想起集合の強度、RAG(AI検索)の発火率を集計した結果です。商品の性能・品質を評価・推奨するものではありません
トップ › 調査仕様
調査仕様
このログの数字が、どの条件で作られているか

対象カテゴリ

分野Amazon ビューティー
階層大カテゴリ(ビューティー)› 中カテゴリ 10 › 小カテゴリ 88(重複4語を除き84件を測定)
質問単位小カテゴリ名。中カテゴリ名を付けないと意味が定まらない7件は中カテゴリ名を前置
取得日2026年8月(Amazon ベストセラーページのカテゴリ名を手作業で採取)

質問

質問文「おすすめの{カテゴリ名}は?」(全カテゴリ同一テンプレート)
回答形式商品名・順位・一言説明を構造化出力で取得。分からない場合は空の回答を許容
試行回数各カテゴリ×各LLMにつき10回。並列5で実行

LLM

GPTChatGPT無料版のデフォルトモデル(API名 gpt-5.6-luna)。推論モードなし
ClaudeClaude Sonnet 5(API名 claude-sonnet-5)
設定temperature・top_p・top_k はいずれも指定せず、各社のデフォルトのまま。利用者が実際に接する条件を優先
記録応答に含まれる実モデル名を測定ごとに保存

想起集合の強度

定義10回の回答に出た商品の顔ぶれの一致度。回答同士の集合の重なり(Jaccard係数)を全組み合わせで平均し、上位順位の一致を重み付けした指標を併用
4段階盤石 0.86以上 / 強固 0.70以上 / 中程度 0.40以上 / 不安定 0.40未満
閾値の根拠0.70/0.40はディギディギの判定値を踏襲。0.86は先行するビールカテゴリの実測で、共起を増やしても強度が動かなかった下限
想起なし10回すべてで商品名が出なかった場合。強度は算出せず「想起なし」と表示
名寄せ同一LLMの10回の回答内で表記ゆれを統合。GPTとClaudeの間では統合しない(両者の表記の違いをそのまま表示)

RAG発火率

定義RAG(AI検索)を使える状態で同じ質問を10回行い、LLMがRAGを呼んだ回数 ÷ 10
条件強度測定とは別に実施。RAGの使用可否はLLM自身の判断に委ね、強制しない
RAG依存発火率 8/10 以上を「RAG依存」と表示
注意API経由の測定であり、ChatGPT・Claudeのアプリ画面での検索挙動と同一とは限らない

更新と表示

更新新しいモデルが公開された時点で再測定。ページは常に最新の測定結果を表示
解説「ディギコの解説」は測定データのみを素材にLLM(Claude Haiku)が生成した文章に、強度と発火率の組み合わせで決まる定型文を付加したもの
商品の説明文LLMの回答をそのまま掲載。事実と異なる場合があり、正誤の検証は行っていない
評価商品の性能・品質の評価・推奨は行わない

運営

運営株式会社トドオナダ(東京都台東区)
測定ツールディギディギ(LLM想起集合測定ツール)の測定基盤を使用
お問い合わせ広報担当 白石(shiraishi@todo-o-nada.com)
自社ブランドはLLMの想起集合に入っていますか?ディギディギなら、任意のカテゴリ・任意のモデルで想起集合の強度とハルシネーションを測定できます。
ディギディギを見る