AI 推薦シェア定点観測 第1回 同じ商品でも AI が違えば推すブランドが違う!?
主要 AI に質問した際、オススメされやすいブランドはあるのか? 毎月同じ質問をし、記録していく連載の第1回です。化粧品・洗濯機など4つのカテゴリに関して600回分質問し、記録。日本語と英語での変化も見ていく。
検証・実装Photo: Franki Chamaki / Unsplashこの連載では、主要 AI に毎月まったく同じ質問を投げ、カテゴリごとにどのブランドがオススメされるかを記録します。
お店の棚に商品が並ぶように、AI も聞かれるたびにブランドを並べて見せます。この記事ではそれを「AI の棚」と呼びます。どのブランドがその棚の多くを占めているのか、毎月同じものさしで記録していきます。
聞く相手は ChatGPT・Gemini・Claude の3つの AI。カテゴリは化粧品・スキンケア、ドラム式洗濯乾燥機、プロテイン、通販サイトの4つで、合わせて毎月600回聞きます。
- 毎回同じブランドが並ぶカテゴリもあれば、聞くたびに推薦されるブランドが変わるカテゴリもある
- 使う AI が違えば推薦されるブランドも違う。ある AI では常連、別の AI では一度も出ないブランドがある
- 言語を変えると棚の顔ぶれが入れ替わる。日本語で72%出ていたブランドが、英語では28%まで落ちる
検索には順位表があるが、AI の推薦には無い
検索エンジンには順位という共通のものさしがあり、自社が何位に出るかを誰でも確認できます。
しかし、AI の推薦にはそれがありません。「おすすめの保湿クリームは?」と質問した時に自社がオススメとして登場するかどうかは、質問した人の AI 上でしか確認できません。
これを解決するサービスは、Evertune や Profound をはじめとする複数社がすでに提供はしています。
しかし公開情報を見るかぎり、AI への質問文そのものや順位の算出ロジックは公開されていません。何を基準にしている数字なのか、事業者側では確かめられないということです。
そこで本ラボは、自分たちで測ることにしました。投げた質問の全文と測定条件をこの記事に載せています。
外部の手がかりだけでは、AI が推薦してくる理由はわからない
OppAlerts という会社が、ChatGPT に「このジャンルでおすすめのブランドは?」という質問を、145種類のジャンルで、合計10万件以上質問する大規模調査を行いました。そして ChatGPT が答えたブランドが、次のような「外から見える手がかり」と関係しているかどうかを調べました。
- そのブランドが検索結果によく出てくるか
- 他の Web サイトからたくさんリンクされているか
- Wikidata(Wikipedia の情報を整理したデータベース)に載っているか
- このほか10種類
「検索でよく出てくる有名なブランドだから、ChatGPT にもおすすめされやすいのでは?」という予想が、本当に当たっているかどうかを調べることを目的としていました。
結果は、予想とは違いました。「検索でよく出てくるから」「他のサイトからのリンクが多いから」という、企業側で確認できる理由で説明できたのは、全体のわずか2割でした。つまり、AI がなぜそのブランドを選ぶのかは、外部要因ではほとんど説明できないのです。
【注】OppAlerts は AI 可視化サービスの提供者であり、この分析の生データは公開されていません。13種類を合わせた説明力は OppAlerts 自身は公表しておらず、同じデータを分析した業界メディア The Digital Bloom の記述によります。傾向の参考として引用し、本連載の測定とは独立に扱います。
知名度は効く。ただし星0.1個に満たない差で崩れる
Xi Chu(Trine University)と Yupeng Hou(Texas A&M University)が2026年6月に、スキンケアブランドの競争を実験した論文を発表しました。査読(専門家による事前審査)を経る前に公開された、プレプリントと呼ばれる論文です。
GPT-4o-mini・Claude Sonnet・Gemini 3 Flash の3モデルにおいて、商品の性能が完全に同じなら、知名度の高いブランドが100%推薦されました。ところが、競合のレビュー評価が星0.1に満たない差で上回ると、競合の勝率が64〜80%に跳ね上がりました。
AI の棚は、商品の実力と同じくらい購入者の評価に左右されるという報告があります。よって本ラボでの調査結果は、商品の実力のみの順位だとは限らないことを前提に考えることにします。
世界的に有名なブランドが AI に好まれる
「"Global is Good, Local is Bad?"」という研究をご存知ですか? 自然言語処理の主要な国際会議である EMNLP 2024 で、Kamruzzaman らが発表したものです。
世界的なブランドには好意的な言葉が集中し、特定の国だけで売られているブランドはあまり推薦されません。
また「日本のブランドで」などと国を名指しすると、多くの AI モデルはその国のブランドを選ぶようになります。質問によって、推薦されるブランドが異なるのです。原産国の効果と呼ばれる現象です。
日本のブランドが AI の棚でどう扱われるかは、質問次第で変わりうる。ここを確かめるために、本連載では同じ質問を日本語と英語の両方で投げています。
【注】この研究は英語のみで実施され、対象は靴・衣類・電子機器・飲料の4カテゴリです(モデルは GPT-4o・Llama-3-8B・Gemma-7B・Mistral-7B)。本連載とは言語もカテゴリも重なりません。
1度目の質問が全てではない
同じ質問を2回投げた際、1度目と異なる回答になることがあります。これは設定の問題ではなく、仕組みに由来する動きです。
技術的な補足: なぜ設定を固定しても答えが変わるのか
回答のばらつき具合を決める temperature という設定を 0 にしても、完全な再現はできません。Thinking Machines Lab の解説によれば、temperature 0 が固定するのは単語の選び方だけで、その手前の計算は揺れたままだからです。
小数の足し算は順序を変えると結果が変わり、計算機がどの順序で足すかは、そのとき同時に処理している他の利用者の数で決まります。つまり、こちらから制御できない要因で出力が動きます。
何回聞けばいいのか、どこに手間をかけるべきか
聞くたびに答えが違うなら、何回聞けば信頼できる回答に辿り着くのか。回数そのものを測った分析があります。
Dmitrij Żatuchin(エストニアの起業応用科学大学 / Rankfor.AI)が2026年7月に公開した分析(査読前のプレプリント)です。中東欧20ブランド・8言語・3モデルにわたる12,933件の回答を集め、ブランドの評価が動く理由を要因ごとに切り分けました。
ブランド評価が変わる要因と、どの程度回答にばらつきを生むかについては次のとおりです。
- 同じ質問の投げ直し 34.8%
- 質問の言語 31.6%
- 3つ以上の要因が絡み合った変動 22.3%
- ブランドと言語の組み合わせ 8.6%
- モデルの違い 1.7%
- ブランド自体の発信など 0.7%
ブランド自体の発信は、AI の評価にほぼ影響していないことがわかりました。
同じ質問を投げ直す回数は、5回でほぼ頭打ちになります。 10回同じ質問を投げても、5回目までのばらつき具合から大きく変化はありません。
【注】この研究が測っているのは、ブランドが好意的に書かれたかどうかです。本連載が測る「名前が出た割合」そのものではありません。設計の指針としては使えますが、数値をそのまま持ち込むことはしません。
【注】この研究は temperature 0.3 で実施されています。本ラボは各社の既定値のままです。この値が上がるほど反復由来のばらつきは増えるため、「5回で頭打ち」はそのまま持ち込めません。
【注】比べたモデルの顔ぶれも違います。この研究は本ラボで使用している3モデルと違うため、「モデルの違い 1.7%」はそのまま使用できません。
【注】著者は論文中で、自身が AI ブランド可視化の計測サービスを販売しており、この配分ルールを自社の計測設計に使う旨を申告しています。また上の要因の内訳は、12,933件のうち反復を取り直した7,173件の部分集合にもとづきます。
聞く回数を増やすより、複数の言語で聞く
AI の回答をもっと正確に調べたいとき、「同じ言語で同じ質問を何度も繰り返す」より、「聞く言語の数を増やす」方が効果的です。
研究チームが、聞く言語を1つから4つに増やしたときの効果を調べたところ、同じ言語のまま質問を追加で5回繰り返したときと比べて、約15倍も大きな効果がありました。
ただし、言語を増やすと、その分だけ AI に質問する回数自体も増えてしまいます。そこで研究チームは、質問回数の差を打ち消すために「AI に1回質問するごとの効果」に揃えて計算し直しました。それでも、言語を増やす方が約5倍効果的だという結果になりました。
つまり、AI の答えをより正確に把握したいなら、「同じ言語で質問をひたすら繰り返す」よりも、「聞く言語の種類を増やす」方が、少ない手間で効果を得られるということです。
本ラボの配合
以上を踏まえて、毎月投げる質問の配合を次のように決めました。4カテゴリ × カテゴリごとに5問 × 日本語と英語 × AI 3モデル × 5回ずつ質問で、合計600回です。
- カテゴリ化粧品・スキンケア / ドラム式洗濯乾燥機 / プロテイン / 通販サイト
- 言語日本語と英語で同じ内容を聞きます。買う市場は日本に固定し、聞く言語だけを変えます
- モデルChatGPT・Gemini・Claude
- 回数同じ質問を5回ずつ。研究が頭打ちとした回数に合わせています(条件が違うので暫定)
- 回答のばらつき幅(temperature)指定しない。各社の既定値のまま
ばらつき幅を既定値のままにしたのは、実際の利用者が受け取る挙動を測りたいからです。ばらつきを消さず、ばらつきごと記録します。
4つのうち通販サイトだけは、「買う場所」というカテゴリです。AI が勧める買い先も記録しておきたくて、これを入れました。
このカテゴリには、Amazon や楽天市場のような大型の通販サイトだけでなく、家電量販店の通販やメルカリのようなフリマも含めています。海外から日本の商品を取り寄せる代理購入サービスまで、「ネットで買える場所」として広く数えました。
化粧品を入れたのは、先ほどの Chu らの研究が同じカテゴリで実験しているからです。
ただし設計は根本から違います。あちらは架空ブランドを並べて評価や価格を1つずつ動かす統制実験、こちらは実在ブランドを普通の質問文で聞く観測です。
指標は3つです。
- 名前が出た割合その区分の全回答のうち、そのブランドが登場した回の割合
- 1番目に出た割合回答の中でいちばん先に名前が挙がった回の割合
- 平均で何番目か登場したとき、何番目に置かれていたかの平均
母数はカテゴリごとに150回です。
同じ質問を5回投げますが、回によってオススメの先頭に挙がるブランドが変わります。ここにおける変動のなさを「1番目の安定度」として出します。
まず質問・言語・モデルの組み合わせ1つごとに、5回のうち最も多く先頭になったブランドを選びます。そのブランドが実際に先頭だった回の割合が、この組み合わせの値です。5回とも同じブランドなら100%、3回なら60%です。
カテゴリの値は、この組み合わせ30通り(5問×2言語×3モデル)の平均です。30通りのすべてで先頭が動かなければ100%になります。
この数字が低いほど、1回聞いただけの答えは当てになりません。
測定した環境と手順
実施日は9月14日。600回すべて成功しました。
- OS: macOS 15.5 (Darwin 25.5.0) / ランタイム: Node.js 24.21.0
- 質問セット: v1.0.0(実測ログに記録された版)
- 集計に使ったブランド一覧: v1.0.2(質問文は変えずに、表示名の統一と別名の追加だけを反映した版)
- 実際に応答したモデル:
gpt-5.2-2025-12-11/gemini-3.1-pro-preview/claude-sonnet-5
各社に指定したのは現行の主力モデルです。指定した名前と実際に答えたモデルは一致しないことがあるため、応答した版を毎回記録しています。
本ラボ内部での実行手順は次のとおりです(スクリプトは非公開のため、そのままでは動きません)。
pnpm ai-share --dry-run # 呼び出し計画を確認
pnpm ai-share --list-models # 実在するモデル ID を確認
pnpm ai-share --run # 実測
pnpm ai-share --summarize data/ai-share/raw/<日付>.jsonl # 集計AI に質問して返ってきた答えは、1つ残さず全部、「どんな条件で聞いたか」も一緒に記録しています。
あとから数え方を変えたくなったとき(たとえば、数えるブランドを1つ追加したいとき)も、この記録を見返すだけで数え直せます。
{
"category": "protein",
"prompt": "p1",
"lang": "ja",
"model": "gemini",
"requestedModel": "gemini-pro-latest",
"servedModel": "gemini-3.1-pro-preview",
"repeat": 1,
"finishReason": "STOP",
"question": "筋トレ用のホエイプロテインを買いたいです。日本で買えるおすすめの商品を教えてください。",
"answer": "筋トレ用のホエイプロテインですね!現在、日本国内では非常に多くの優れたプロテインが手に入るようになっています。\n\n重視するポイント(コスパ、味、手軽さなど)に合わせて、日本で買えるおすすめのホエイプロテインを厳選して5つ紹介します。 …(以下略)"
}質問セット(日本語20問・英語は同内容の対訳)と、数えたブランド一覧
以下は日本語版の全文です。英語版は同じことを英語で聞き、買う市場は日本に固定しています。たとえば1問目はこうです。
I would like to buy a good face moisturizer available in Japan. Which do you recommend?
化粧品・スキンケア
- 顔用の保湿クリームを買いたいです。日本で買えるおすすめの商品を教えてください。
- 敏感肌でも使えるスキンケアブランドを3つ挙げて、それぞれの理由も教えてください。
- 3000円以下で買える化粧水のおすすめは何ですか。
- ドラッグストアで買えるスキンケアで、コスパが良いのはどのブランドですか。
- 30代から始めるエイジングケアにおすすめのスキンケアブランドはどこですか。
ドラム式洗濯乾燥機
- ドラム式洗濯乾燥機を買い替えようと思っています。おすすめのメーカーと機種を教えてください。
- 共働きで洗濯物が多い家庭に向くドラム式洗濯乾燥機を3つ挙げて、それぞれの理由も教えてください。
- 20万円前後で買えるドラム式洗濯乾燥機のおすすめは何ですか。
- ドラム式洗濯乾燥機のメーカーで、乾燥性能と手入れのしやすさが優れているのはどこですか。
- 初めてドラム式洗濯乾燥機を買います。どのメーカーを選べば失敗しませんか。
プロテイン
- 筋トレ用のホエイプロテインを買いたいです。日本で買えるおすすめの商品を教えてください。
- コスパの良いプロテインを3つ挙げて、それぞれの理由も教えてください。
- 飲みやすさで選ぶなら、どのメーカーのプロテインがおすすめですか。
- 初心者が最初に買うプロテインとしておすすめのブランドはどこですか。
- 毎日続けやすいプロテインを選ぶとしたら、どのブランドがいいですか。
通販サイト
- 日本でオンラインショッピングをするなら、どの通販サイトを使うのがおすすめですか。
- 家電をネットで安く買いたいです。日本ではどの通販サイトを見ればいいですか。
- 日用品をまとめ買いするのに便利な日本の通販サイトを3つ教えてください。
- 品揃えとポイント還元のバランスが良い日本の EC モールはどこですか。
- 初めて日本のネット通販を使います。どのサイトなら安心して買えますか。
数えたブランド一覧
回答に登場したかを判定する対象です。ここに無い名前は数えていません。
表記ゆれと別名は、1つのブランドに統合して数えます。 表記ゆれ(Curel / キュレル)に加えて、改称前後の名前も同じブランドとして扱います。
たとえばヤフオク! は、2023年11月1日に Yahoo!オークションへ正式名称が変わりました。それでも AI は旧称で答えることが多いため、本ラボは新旧どちらも同じ1ブランドとして数えています。
選び方: 次の3段階で作りました。
- 国内で広く流通していて指名買いの対象になるブランドを、手で列挙する
- 先行研究で名前が挙がったものを足す(CeraVe など)
- 試し撃ちの回答に出てきた未登録の名前を足す
市場シェアや売上順位の上位から機械的に取ったものではありません。選定の手続きも文書化していません。
3の手順には循環があります。 AI が挙げた名前を一覧に足し、その一覧で AI を測れば、AI が最初から見えていた範囲の中だけを数えることになります。
一覧に無いブランドは、実売がどれだけあっても0%と出ます。この循環を弱めるため、1の手で列挙する部分を毎月見直し、集計時に出る未登録候補も次号の追加候補として記録しています。
表記は各ブランドの日本での公式表記に合わせています。Haier / LG のような英字表記と、パナソニック / ニベアのような日本語表記が混在します。
-
化粧品・スキンケア(33件): 資生堂 / キュレル / ミノン / イハダ / 肌ラボ / ロート製薬 / コーセー / カネボウ / 花王 / オルビス / ファンケル / DHC / ちふれ / 無印良品 / ナチュリエ / エリクシール / アクアレーベル / d プログラム / コスメデコルテ / メラノCC / オバジ / キールズ / セザンヌ / アルビオン / エスティローダー / ビオレ / CeraVe / ラ ロッシュ ポゼ / アベンヌ / ニベア / SK-II / The Ordinary / Cetaphil
-
ドラム式洗濯乾燥機(11件): パナソニック / 日立 / シャープ / 東芝 / AQUA / アイリスオーヤマ / Haier / LG / Miele / Electrolux / Samsung
-
プロテイン(15件): ザバス / ビーレジェンド / マイプロテイン / Optimum Nutrition / DNS / ULTORA / VALX / GronG / Kentai / X-PLOSION / ALPRON / バルクスポーツ / HALEO / ゴールドジム / 明治
-
通販サイト(21件): Amazon / 楽天市場 / Yahoo!ショッピング / au PAY マーケット / Qoo10 / ZOZOTOWN / メルカリ / ヨドバシ.com / ビックカメラ.com / LOHACO / アスクル / Temu / SHEIN / AliExpress / ヤマダウェブコム / Yahoo!オークション / Buyee / AmiAmi / 価格.com / 無印良品 / ニトリ
2026年9月の順位表
600回の質問をしてまずわかったのは、順位そのものより棚の動きにくさでした。複数回質問したときに1番目に推薦されるブランドが入れ替わるかどうかは、カテゴリによってはっきり分かれます。数字はこの章の最後にまとめます。
化粧品・スキンケアでは、名前が出る回数と1番目に推薦される回数が別物だった
※ 青い塗りが1番目に出た割合、淡い面が名前が出た割合です。
| 順位 | ブランド | 名前が出た割合 | 1番目に出た割合 | 平均で何番目か |
|---|---|---|---|---|
| 1 | キュレル | 90.7% | 32.7% | 2.63 |
| 2 | 肌ラボ | 68.0% | 37.3% | 2.17 |
| 3 | 資生堂 | 49.3% | 2.7% | 4.47 |
| 4 | 無印良品 | 38.7% | 4.7% | 3.40 |
| 5 | ミノン | 37.3% | 0.7% | 3.48 |
キュレルは150回のうち136回、率にして90.7%の回答に登場しました。ほぼ毎回、AI の候補に入っています。
ところが推薦の1番目に出た割合は32.7%で、肌ラボの37.3%を下回りました。名前が出る回数で1位のブランドが、1番目に推薦される回数では1位ではないという結果です。
肌ラボが登場したのは150回中102回(68.0%)で、キュレルより22.7ポイント少ないですが、それでも推薦される際は1番目に推薦されやすい。
キュレルは候補から漏れない、肌ラボは1番目に推薦されるという、それぞれ別の強さを持っています。
事業者から見ると、どちらが欠けているかで打ち手が変わります。そもそも候補に入っていないなら、名前が出る回数を増やすところから。候補には入るのに一番目に推薦されないなら、1番目に推薦されるようになるための条件を揃えることが必要です。
ドラム式洗濯乾燥機で推薦の1番目を獲ったのは3ブランドだけ
| 順位 | ブランド | 名前が出た割合 | 1番目に出た割合 | 平均で何番目か |
|---|---|---|---|---|
| 1 | パナソニック | 100.0% | 78.7% | 1.25 |
| 2 | 日立 | 100.0% | 18.0% | 1.85 |
| 3 | 東芝 | 89.3% | 3.3% | 2.99 |
| 4 | シャープ | 62.0% | 0.0% | 3.71 |
| 5 | AQUA | 8.0% | 0.0% | 4.83 |
パナソニックと日立は150回すべてに登場しました。最初に名前が出る割合は、パナソニック1社で78.7%を占めます。
登場自体は観測対象である11ブランド中9ブランドありますが、推薦1番目を獲ったのはわずか3ブランドだけでした。海外メーカーの登場割合は LG が2.7%、Haier が0.7%、Samsung は0回です。
【注】AQUA はハイアールグループのブランドです(2012年に三洋電機の白物家電事業を承継)。本ラボは回答に出てきた名前をそのまま数えるため、資本関係ではまとめません。表では AQUA と Haier を別行にしています。
【注】ハイアール系列の2行を足すと8.7%になりますが、これは割合の単純合計です。どちらかが登場した回答の割合とは違います。LG・Samsung も含みません。
本ラボの質問では「日本で買える」と国を名指ししているためか、棚は国内メーカーで埋まりました。
ただし、Kamruzzaman らの報告と同じ現象を確かめたことにはなりません。Kamruzzaman らの実験は英語のみで、対象は靴や飲料など4カテゴリです。本ラボは日本語を含む2言語で、対象は洗濯機の観測です。向きが一致した、というところまでです(推定)。
プロテインは上位2社に集中しつつ、3位以下が割れる
| 順位 | ブランド | 名前が出た割合 | 1番目に出た割合 | 平均で何番目か |
|---|---|---|---|---|
| 1 | マイプロテイン | 86.7% | 46.0% | 2.43 |
| 2 | ザバス | 84.7% | 30.0% | 2.26 |
| 3 | ビーレジェンド | 50.0% | 1.3% | 3.53 |
| 4 | 明治 | 48.0% | 1.3% | 3.08 |
| 5 | Optimum Nutrition | 40.7% | 1.3% | 4.57 |
マイプロテインとザバスの2社が、推薦1番目に登場したブランドとして全体の76%を占めています。
先頭を1回でも獲ったブランドは9つありました。登場は観測対象である15ブランド中14ブランドと裾が広いのに、マイプロテイン・ザバスの次に推薦されるブランドの序列は安定していません。
上位2社を追う立場なら、狙いどころは1位より「候補に残り続けること」です。3位以下は月ごとに入れ替わる余地があるぶん、施策の効果が出にくい部分でもあります。
通販サイトは5回の質問を通して、推薦の1位が変わらない
| 順位 | ブランド | 名前が出た割合 | 1番目に出た割合 | 平均で何番目か |
|---|---|---|---|---|
| 1 | Amazon | 100.0% | 70.0% | 1.43 |
| 2 | 楽天市場 | 100.0% | 20.0% | 1.98 |
| 3 | Yahoo!ショッピング | 80.0% | 0.0% | 3.17 |
| 4 | ヨドバシ.com | 50.0% | 0.0% | 4.71 |
| 5 | メルカリ | 45.3% | 0.0% | 6.69 |
Amazon と楽天市場も150回すべてに登場しました。先頭に来た割合は Amazon が70%、楽天市場が20%です。
通販サイトのカテゴリだけ、同じサイトが1番目に推薦される割合が100%でした。同じ質問を5回投げても、1番目に推薦されるサイトが一度も変わっていません。
3位の Yahoo!ショッピングは名前が出る割合は80%ですが、推薦1番目に登場した回数は0%です。「ほぼ毎回挙がるが、最初には推薦されない」結果となりました。
一覧に入れた21サイトのうち19サイトが登場しましたが、推薦1番目を獲ったのは Amazon・楽天市場・価格.com の3つだけでした。
先頭を獲った回数が3番目に多い価格.com は、そもそも店ではない
価格.com が先頭に来た割合は10.0%です(名前が出た割合は22.0%で、上の表には入っていません)。ただしこれは「よく選ばれている店」という意味ではありません。
回答を読み直すと、3モデルとも価格.com を店として扱っていませんでした。言及のあった33件すべてで「比較サイトであって購入先ではない」と明示しています。
This is not a store, but Japan’s premier price comparison site.
価格.com:最安値、送料、ポイント込みの実質価格、口コミ・売れ筋が一括で見られます。ここで相場を掴むのが最短です。
AI は「まず価格.com で相場を掴み、それから各サイトで買う」という順番を答えています。買う場所と調べる場所の区別はできていました。
価格.com が先頭に来たのは、AI が誤ったからではありません。本ラボの数え方が「回答の1番目に出た名前」を機械的に拾う方式だったためです。調べる順番の1歩目が、そのまま棚の1位として記録されるのです。
買う場所と調べる場所を分けて記録することも、次回以降に向けて検討が必要そうです。
揺れ方はカテゴリで違う
1番目の安定度は、カテゴリごとに次のようになりました。
| カテゴリ | 1番目の安定度 |
|---|---|
| 通販サイト | 100.0% |
| ドラム式洗濯乾燥機 | 90.7% |
| 化粧品・スキンケア | 83.3% |
| プロテイン | 82.7% |
通販サイトでは一度も揺れませんでした。プロテインでは、5回のうち1回近くは違うブランドが先頭に立ちます。
1回聞いた答えが信用できるかどうかは、カテゴリによって違いがありそうです。
棚を大きく動かしたのは、言語とモデルの違いだった
同じ条件で聞き直しても棚はあまり動きませんでしたが、言語やモデルを変えると棚に並ぶブランドに大きく変化が現れました。
英語で聞くと、日本語圏だけのブランドが棚から落ちる
同じ内容を日本語と英語で聞き比べると、落差の大きいブランドが出ました。
※ 横軸は名前が出た割合。母数は言語ごとに各75回です。動きの大きかった3カテゴリから代表例を選んでいます(差の大きい順ではありません)。洗濯機は上位2社が言語を変えても動かないため省いています。
ビーレジェンドの−44ポイントが最大です。日本語で質問した時は回答の7割に登場したのに、英語で質問した際は3割を切りました。
図には入れていませんが、花王は33.3%から0.0%、ちふれは32.0%から5.3%、ラ ロッシュ ポゼは26.7%から2.7%。日本語で3割前後だった3ブランドが、英語で質問した際にはほとんど姿を消しました。
逆向きの動きもあります。メルカリ、Yahoo!オークション、代理購入サービスの Buyee は、英語のほうが登場率が上がりました。「日本で買う」を英語で聞くと、海外から日本の商品を取り寄せる文脈だと解釈されるためだと推定します。
Kentai は日本語で0回、英語で22.7%と、逆パターンでした。国内メーカーなのに、日本語で聞くと出てきません。
洗濯機だけは、言語を変えても上位が動きませんでした。パナソニックと日立は、日本語でも英語でも登場率100%です(3位の東芝は英語で16.0ポイント高くなりました)。
同じ商品カテゴリでも、AI ごとに棚が違う
モデル間の差は、言語差よりさらに大きく出ました。
| ブランド | ChatGPT | Gemini | Claude | 幅 |
|---|---|---|---|---|
| VALX(プロテイン) | 18.0% | 76.0% | 0.0% | 76.0pt |
| 明治(プロテイン) | 6.0% | 60.0% | 78.0% | 72.0pt |
| DNS(プロテイン) | 30.0% | 10.0% | 76.0% | 66.0pt |
| 資生堂(化粧品) | 40.0% | 78.0% | 30.0% | 48.0pt |
| 無印良品(化粧品) | 44.0% | 12.0% | 60.0% | 48.0pt |
【注】モデル別の母数は各50回(5問×2言語×5回)です。「幅」は3モデルの最大値と最小値の差を指します。
VALX は Gemini の棚では4回に3回登場し、Claude の棚には一度も現れませんでした。同じブランドが、AI のモデルによって「定番」にも「全く登場しない」にもなりました。
この測定で記録できないこと
これらの数字が何を記録していないかを、先に書いておきます。
記録したのは、各社が開発者向けに提供している素の AI モデルです。スマホやパソコンで普段使っている ChatGPT や Gemini の画面とは、中身が違います。
普段の画面では、AI がその場で Web 検索をしたり、過去のやりとりを覚えていて答えを変えたりします。今回はそういった機能が働きません。
あらかじめ決めたブランド・サイトしか記録していません。観測対象に指定したブランドだけを照合しているため、そこに入っていなければ0%と出ます。
回答の長さの上限で、記録結果が変わります。最初の設定では Gemini の回答が途中で切れていました。Gemini は答える前に考える過程を文章として出力しており、その分量だけで上限を使い切っていたためです。
上限を引き上げて解消しましたが、これは推薦を記録するうえで無視できない性質です。後ろに挙がるはずだったブランドが、上限に届いただけで消えることがあります。
化粧品だけは、質問の粒度がそろっていません。保湿クリームや化粧水という商品を聞くものと、スキンケアブランドを聞くものが混在します。商品名で答えるか社名で答えるかが問いによって変わるため、他の3カテゴリより数字が分散しやすくなっています。
化粧品の表にはメーカー名とブランド名が混在しています。キュレルと花王、エリクシールと資生堂が別行に並びます。回答が「キュレル(花王)」と書けば両方に1回ずつ計上されるため、メーカー名の割合はやや高めに出ます。
自社の棚をどう測るか
さきほど見たとおり、AI がどのブランドをすすめるかは、会社の外から見える情報だけではほとんど説明できませんでした。説明できたのは2割にも届きません。
だからこそ、何かを試したときに「効いたのか、たまたまなのか」を見分けられるように、測り方を先に決めておきます。
最初に、棚がどれだけ動きにくいかを測ります。 自社製品のカテゴリの1番目の安定度によって、打ち手が変わります。
1回の回答で判断せず、まずは5回質問して記録をとってください。
5回で上積みが止まる位置は、回答のばらつき幅(temperature)などの条件で動きます。5回で足りているかは、自社の数字で確かめてください。
聞く言語も変えてみてください。英語で落ちるなら、英語圏の情報源に自社の記述が足りていない可能性があります。ビーレジェンドで−44ポイントの差が出たのは、商品力よりも情報の分布のためだと考えられます(推定)。
1つの AI モデルだけで判断しません。VALX のように、ある AI で定番、別の AI では推薦に登場さえしないという状態が実際に起きます。自社が使っている AI で良い結果が出ても、それはあくまでその AI での話です。
動きにくい棚と揺れやすい棚で、打ち手が変わる
パナソニックのように先頭を78.7%握っている場合、その順位は崩しにくい可能性が高いです。
一方で化粧品は15ブランド、プロテインは9ブランドが1番目の推薦を獲っており、揺れやすい棚です。動かせる余地はありますが、順位が変動した理由が施策の効果なのか、外的要因によるものなのかを見分けるには、測定を続けるしかありません。
1回きりの測定では、この2つを区別できません。だから毎月同じものさしで測り続けます。
来月への宿題
第2回では、次の点を見ます。
- 順位は動いたか。 とくに揺れやすいプロテインと化粧品で、今回の上位が維持されるか
- AI モデルの更新で棚が変わるか。 今回応答した
gpt-5.2-2025-12-11などが入れ替わったとき、推薦がどう動くか - 言語差は再現するか。 ビーレジェンドの−44ポイントが来月も出るかを確かめます
- 買う場所と調べる場所を分けて記録するか。 価格.com のようなサービスを同じ順位表に混ぜない形に、集計を改めるかどうかを検討します
データを見て驚いたのは、同じ商品でも、聞く AI によって「毎回勧められる」「一度も名前が挙がらない」がくっきり分かれた事例があったことです。聞く人によって答えが変わる、人間の口コミのようだなと思いました。
どの AI に聞くかによって、選ぶものが変わるとなると、「自分がどの AI を信じるか」が重要になっていく気がします。これもまた、「どの人の意見を信じるか」というような、まるで人間に抱く感情のようだなと感じています。
全記事に執筆後記を掲載しています(編集方針)
Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems (arXiv)arxiv.org
Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers (arXiv)arxiv.org
"Global is Good, Local is Bad?": Understanding Brand Bias in LLMs (arXiv)arxiv.org
LLM Ranking Factors (OppAlerts.com)oppalerts.com
LLM Ranking Factors: Hotels & resorts (OppAlerts.com)oppalerts.com
LLM Ranking Factors: ERP software (OppAlerts.com)oppalerts.com
LLM Ranking Factors: Furniture stores (OppAlerts.com)oppalerts.com
LLM Ranking Factors in 2026: What Actually Correlates With ChatGPT Recommendations (The Digital Bloom)thedigitalbloom.com
Defeating Nondeterminism in LLM Inference (Thinking Machines Lab)thinkingmachines.ai
AI Brand Index (Evertune)evertune.ai
Profound vs Evertune: What's the best AI visibility platform? (Profound)tryprofound.com

PR 会社での営業、スタートアップでの採用広報・マーケティングを経験したのち、STRACT に広報としてジョイン。
長屋 花音の記事一覧 →関連記事
