AI 回答者は98%が正解を知っていると答えた。実在の人では52%だった。合成ユーザーでスタートアップを検証してはいけない

Surya Pratap
By Surya Pratap

2026年10月1日

9 min read

MVP Strategy
二部構成の図。左は、実在の米国の回答者と、その人自身のプロフィールから作った AI のデジタルツインを比べる棒の組で、合衆国憲法修正第1条に関する質問では実在の人の52パーセントが正答したのに対し AI 回答者は98パーセント、ワールドカップを追っていると答えたヒスパニックの成人は実在が43パーセントに対し AI は97パーセント、データセンターのニュースを聞いたのは実在が25パーセントに対し AI は3パーセントだった。右は約300問にわたる Pew Research の調査の全体像で、平均誤差は12.4ポイント、28パーセントの質問で15ポイントを超える誤差、実在の人は「わからない」を約4倍多く選び、ほぼ半数の質問で、どの AI 回答者も選ばなかった選択肢が少なくとも一つあった。自信満々で、穏当で、間違っているHover to explore
AI の代役は実在の人より物知りで、実在の人より確信が強く、本人よりもステレオタイプのように答えた。あなたが受け取る顧客調査も、同じものになる。

誰とも話さずにアイデアを検証する創業者が増えている。ターゲット顧客を言語モデルに説明し、数百人の「合成ユーザー」を生成して、買うかどうかを尋ねる。答えは速く、安く、自信に満ちて返ってくる。Pew Research がこの発想を実在の人と丁寧に比較して試したところ、問題はまさにその自信だった。

数字は、Athena Chapekis、Arnold Lau、Samuel Bestvater、Sono Shah、Andrew Mercer、Aaron Smith が2026年9月30日に公開した Pew Research Center の二つの報告、"Can AI stand in for human survey takers? Not really" と "How synthetic polling results change based on the AI model" による。Pew が調べたのは世論調査であり、製品調査ではない。その結果を創業者に当てはめるのは、第3節以降の筆者の解釈である。

1. Pew が試したこと

Pew は、実在の米国の成人で構成される大規模なパネル American Trends Panel を運営し、繰り返し調査を行っている。今回の研究では、パネルの各参加者について 「デジタルツイン」 を作った。AI モデルにその人の属性情報と、以前の政治類型調査への回答を与え、その人が答えるように新しい調査に回答させたのだ。

ツインは2026年初めの実際の調査三つ、合計 約300問 に、人間と同じ文言と指示で回答した。Pew はその回答を実在の人の回答と比べた。主に使ったモデルは Anthropic の Claude Opus 4.6 で、二つ目の報告では OpenAI の GPT-5.1 でも同じことを行った。

これは合成回答者にとってほぼ最良の条件だ。各ツインは、短いペルソナ説明ではなく、実在の人自身の詳細な回答から作られている。

2. 回答はどれだけ外れたか

三つの調査を通して、AI の回答は実際の回答から 平均12.4ポイント 外れた。約28%の質問 では誤差が15ポイントを超え、個々の回答で20〜40ポイントの差が出ることも珍しくなかった。

いくつかの例が、外れ方の形を示している。

  • データセンターのニュースを聞いた: 実在の人の25%、AI ツインの3%。
  • 合衆国憲法修正第1条に関する質問: 正答したのは実在の人の52%、ツインの98%。
  • NATO に関する質問: 正答は実在の人の56%、ツインの99%。
  • ワールドカップを追っているヒスパニックの成人: 実際は43%、AI では97%。

Pew の結論は、AI モデルは広く重要なテーマについて実在の人に調査することの「適切な代替にはならない」、そしてその結果は「しばしば予測できない形で異なる」というものだ。

ツインは実在の人自身の回答から作られていたのに、それでも平均12ポイント食い違った。

3. 五つの失敗と、それぞれが顧客調査に与える影響

Pew は、AI の間違え方に一貫したパターンを見つけた。どれも、創業者が合成ユーザーに尋ねたくなることに対応している。

知りすぎている。 AI ツインは知識を問う質問に、実在の人よりはるかに高い率で正答した。ある質問では98%対52%だった。合成顧客は、あなたの製品カテゴリーも専門用語も価値提案も理解する。実在の顧客の多くは理解しない。製品がつまずくのは、その差の中だ。

めったに迷わない。 実在の人は「わからない」を AI の約 4倍 多く選んだ。顧客調査では「わからない、考えたこともない」が最も重要な答えであることが多い。合成ユーザーはそれをほとんど返さない。

極端な回答を飛ばす。 ほぼ半数の質問で、どの AI 回答者も選ばなかった選択肢が少なくとも一つあった。決して買わない人々と、明日にも買う小さな集団こそ、合成サンプルが取りこぼす人々だ。

ステレオタイプを演じる。 AI ツインは自分の属する集団の戯画のように答えた。ワールドカップを追っているヒスパニックのツインは97%で実際は43%、イスラエルに好意的な共和党支持者のツインは95%で実際は58%だった。理想の顧客を説明すれば、モデルはその顧客の決まり文句のように答える。

五つ目の失敗は、新しいものすべてにとって最も重要だ。最大の外れは 最近の出来事 で起きた。データセンターの質問は、モデルが以前の傾向にアクセスできたにもかかわらず22ポイント外れた。新しい製品カテゴリーとは、定義上、実在の人がまだ出会ったことのないものだ。合成回答が最も当てにならないのは、まさにその状況である。

4. モデルを変えれば、市場が変わる

Pew の二つ目の報告は、同じデジタルツインを二つのモデルで動かした。両者は、現実との間と同じくらい互いに食い違った。

  • 国の現状に不満: 実在の人の69%、Claude のツインの70%、GPT のツインの 100%。
  • トランプ氏を「非常に強く」支持するトランプ投票者: 実際は65%、Claude で46%、GPT で 88%。
  • 段階評価の質問で中間の選択肢を選ぶ: 実在の人の45%、Claude のツインの 56%、GPT のツインの 31%。

一方のモデルは全員を穏当にした。もう一方は全員を極端にした。Pew のまとめはこうだ。それぞれの合成サンプルは「米国の人々についてまったく異なる姿を描き」、そして「どちらも実際の世論を本当には反映していなかった」。

創業者にとっては、合成ユーザー調査が描く「市場」が、たまたま使ったモデルに部分的に左右されるということだ。モデルを変えれば、支払意思額の曲線が動く。

5. 合成ユーザーがまだ役立つこと

Pew は、AI が調査に役立たないとは言っていない。役立つ場面として二つを挙げている。自由回答の実際の答えを分類すること、そして調査結果を分析するコードを書くことだ。 どちらでも、AI は答えを作り出すのではなく、実在の人が言ったことを処理している。

創業者にとっても、同じ原則から役立つリストが作れる。

  1. インタビューガイドの下書き。

    モデルに質問案を出させ、答えを誘導するものを削る。速く、出てきたものを証拠として扱うこともない。

  2. 文言の事前テスト。

    実在の人が見る前に、アンケートをモデルに通して、わかりにくい質問や二つのことを同時に聞く質問を見つける。

  3. 反論の練習。

    懐疑的な買い手を演じさせてピッチを練習する。スパーリングとして扱い、買い手が何を言うかの予測としては扱わない。

  4. 記録のコーディング。

    実在の人と話した後、モデルを使ってメモのテーマにタグを付ける。Pew が認めている使い方だ。

できないのは、人々があなたの作っているものを欲しがるか、何人いるか、いくら払うかを教えることだ。

6. 本当に効く、より安い方法

その問題を抱えている実在の人との5回の会話は、合成ユーザーとの500回の会話より多くを教えてくれる。驚かせてくれる可能性があるからだ。「わからない」「聞いたことがない」「それは何年も前にスプレッドシートで解決した」と言ってくれる。Pew によれば、AI がほとんど返さない答えそのものだ。

そうした会話を組んだことがなければ、ディスカバリーコールの準備の仕方と、コミュニティでの関心を最初の有料顧客につなげる方法についての私たちのガイドで手順を説明している。

7. 筆者が主張しないこと

Pew が調べたのは世論であり、製品の需要ではない。 質問は政治、時事、知識に関するものだった。仕組みが同じなのでそのパターンを顧客調査に当てはめているが、Pew は製品に関する質問を試していない。

比較したのは二つのモデルである。 主なモデルは Claude Opus 4.6 で、比較では GPT-5.1 が加わった。見出しの12.4ポイントは三つの調査の平均であり、モデル比較では対象の質問について Claude が11.4ポイント、GPT が13.3ポイントだった。ほかのモデル、プロンプト、方法なら、結果はよくも悪くもなりうる。

よりよい方法で差は縮まるかもしれない。 Pew 自身がそう述べている。新しいモデルや合成サンプルの新しい作り方によって、誤差は小さくなる可能性がある。これは現時点の測定であり、恒久的な限界ではない。

あなたの合成ユーザーは、おそらくもっと少ない情報から作られている。 Pew のツインは、各人自身の詳細な回答から作られていた。創業者が作るペルソナの多くは、1段落の説明だ。そこから、創業者が作る合成ユーザーはもっと悪い結果になると考えられるが、それは筆者の推論であり、Pew が試したことではない。

正直なまとめ

Pew は、多くの創業者が望みうる中で最も丁寧な合成回答者、つまり実在の人自身の回答から作った AI ツインを用意したが、それでも平均で約12ポイント外れた。実在の人より物知りで、確信が強く、極端な回答を避け、自分の集団のステレオタイプのように答えた。新しいテーマでは最も成績が悪かった。そしてモデルを変えると、描かれる姿が変わった。

スタートアップにとって、これらは例外ではない。製品を実際よりも求められていて、よく理解されていて、幅広く魅力的に見せてしまう誤りそのものだ。

AI は顧客との会話の準備と分析に使うこと。会話の代わりに使ってはいけない。

出典:Athena Chapekis、Arnold Lau、Samuel Bestvater、Sono Shah、Andrew Mercer、Aaron Smith、"Can AI stand in for human survey takers? Not really"、Pew Research Center、2026年9月30日。デジタルツインの手法、2026年初めの American Trends Panel の三つの調査と約300問、平均12.4ポイントの誤差、15ポイントを超える質問の割合、データセンター、修正第1条、NATO、ワールドカップの例、「わからない」の4倍の差、どの AI 回答者も選ばなかった選択肢、ステレオタイプの例、AI にできることとできないことについての Pew の結論。同じ著者による "How synthetic polling results change based on the AI model"、Pew Research Center、2026年9月30日。Claude Opus 4.6 と GPT-5.1 の比較、11.4ポイントと13.3ポイントの誤差、中間の選択肢を選ぶ率、モデル間の食い違いの例、将来の手法についての注意点。引用は本稿では翻訳して示している。第3節から第6節の顧客調査への当てはめは筆者のものである。

IdeaToMVP Academy

Want to build with AI — not just read about it?

4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.

Explore the Academy →
Share this post :