Les sondés IA disaient que 98 % connaissaient la réponse. Chez les vraies personnes, 52 %. Ne validez pas votre startup avec des utilisateurs synthétiques

Surya Pratap
By Surya Pratap

1 octobre 2026

9 min read

MVP Strategy
Schéma en deux parties. À gauche, des paires de barres comparant de vrais sondés américains à des jumeaux numériques IA construits à partir de leurs propres profils : sur une question portant sur le Premier amendement, 52 pour cent des vraies personnes ont répondu juste contre 98 pour cent des répondants IA ; 43 pour cent des adultes hispaniques disaient suivre la Coupe du monde contre 97 pour cent pour l'IA ; et 25 pour cent avaient entendu parler des centres de données dans l'actualité contre 3 pour cent pour l'IA. À droite, la vue d'ensemble de l'étude de Pew Research sur environ 300 questions : une erreur moyenne de 12,4 points, plus de 15 points d'écart sur 28 pour cent des questions, de vraies personnes choisissant « je ne sais pas » environ quatre fois plus souvent, et près de la moitié des questions avec au moins une réponse qu'aucun répondant IA n'a choisie.Sûrs d'eux, modérés, et à côtéHover to explore
Les substituts IA en savaient plus que les vraies personnes, étaient plus sûrs d'eux, et répondaient davantage comme le stéréotype que comme la personne. C'est la recherche client qu'ils vous fourniront aussi.

De plus en plus de fondateurs valident leurs idées sans parler à personne. Ils décrivent leur client cible à un modèle de langage, génèrent quelques centaines d'« utilisateurs synthétiques » et leur demandent s'ils achèteraient. Les réponses arrivent vite, coûtent peu et paraissent sûres d'elles. Pew Research vient de tester cette même idée face à de vraies personnes, avec soin, et c'est justement cette assurance qui pose problème.

Les chiffres proviennent de deux rapports du Pew Research Center publiés le 30 septembre 2026 par Athena Chapekis, Arnold Lau, Samuel Bestvater, Sono Shah, Andrew Mercer et Aaron Smith : « Can AI stand in for human survey takers? Not really » et « How synthetic polling results change based on the AI model ». Pew a étudié des sondages d'opinion, pas de la recherche produit. L'application de ces résultats aux fondateurs est mon interprétation, à partir de la section 3.

1. Ce que Pew a testé

Pew gère l'American Trends Panel, un large panel d'adultes américains réels qu'il interroge régulièrement. Pour cette étude, il a créé un « jumeau numérique » de chaque membre du panel : on a fourni à un modèle d'IA les données démographiques de la personne et ses réponses à une précédente enquête de typologie politique, puis on lui a demandé de répondre à de nouvelles enquêtes comme l'aurait fait cette personne.

Les jumeaux ont répondu à trois vraies enquêtes du début de 2026, soit environ 300 questions au total, avec la même formulation et les mêmes consignes que les humains. Pew a ensuite comparé leurs réponses à celles des vraies personnes. Le modèle principal était Claude Opus 4.6, d'Anthropic. Un second rapport a refait l'exercice avec GPT-5.1, d'OpenAI.

C'est presque le meilleur cas possible pour des répondants synthétiques. Chaque jumeau a été construit à partir des propres réponses détaillées d'une personne réelle, et non d'une courte description de persona.

2. L'ampleur de l'écart

Sur les trois enquêtes, les réponses de l'IA s'écartaient des vraies de 12,4 points de pourcentage en moyenne. Sur environ 28 % des questions, l'erreur dépassait 15 points, et les écarts de 20 à 40 points sur des réponses précises étaient fréquents.

Quelques exemples montrent la forme de ces erreurs :

  • A entendu parler des centres de données dans l'actualité : 25 % des vraies personnes, 3 % des jumeaux IA.
  • Une question sur le Premier amendement : 52 % de bonnes réponses chez les vraies personnes, 98 % chez les jumeaux.
  • Une question sur l'OTAN : 56 % de bonnes réponses chez les vraies personnes, 99 % chez les jumeaux.
  • Adultes hispaniques qui suivent la Coupe du monde : 43 % en réalité, 97 % selon l'IA.

La conclusion de Pew : les modèles d'IA ne sont « pas un substitut adéquat » à l'interrogation de vraies personnes sur des sujets d'importance générale, et leurs résultats « diffèrent de façon souvent imprévisible ».

Les jumeaux avaient été construits à partir des propres réponses des vraies personnes, et ils s'en écartaient pourtant de douze points en moyenne.

3. Cinq défauts, et ce que chacun fait à la recherche client

Pew a relevé des schémas constants dans la façon dont l'IA se trompait. Chacun correspond à une question que les fondateurs sont tentés de poser à des utilisateurs synthétiques.

Ils en savent trop. Les jumeaux IA répondaient juste aux questions de connaissances bien plus souvent que les vraies personnes : 98 % contre 52 % sur l'une d'elles. Un client synthétique comprendra votre catégorie, votre jargon et votre proposition de valeur. La plupart de vos vrais clients, non, et c'est dans cet écart que les produits échouent.

Ils doutent rarement. Les vraies personnes ont choisi « je ne sais pas » environ quatre fois plus souvent que l'IA. En recherche client, « je ne sais pas, je n'y ai jamais pensé » est souvent la réponse la plus importante qu'on puisse obtenir. Les utilisateurs synthétiques ne la donnent presque jamais.

Ils évitent les extrêmes. Sur près de la moitié des questions, au moins une réponse proposée n'a été choisie par aucun répondant IA. Ceux qui n'achèteraient jamais, et le petit groupe qui achèterait dès demain, sont précisément ceux qu'un échantillon synthétique laisse de côté.

Ils jouent le stéréotype. Les jumeaux IA répondaient comme la caricature de leur groupe : 97 % des jumeaux hispaniques suivaient la Coupe du monde contre 43 % en réalité, 95 % des jumeaux républicains avaient une opinion favorable d'Israël contre 58 %. Décrivez votre client idéal, et le modèle répondra comme le cliché de ce client.

Le cinquième défaut compte le plus pour tout ce qui est nouveau. Les plus gros écarts portaient sur l'actualité récente — la question sur les centres de données était fausse de 22 points —, alors même que le modèle avait accès aux tendances antérieures. Une nouvelle catégorie de produits est, par définition, quelque chose que les vraies personnes n'ont encore jamais rencontré. C'est exactement la situation où les réponses synthétiques sont les moins fiables.

4. Changez de modèle, et votre marché change

Le second rapport de Pew a fait tourner les mêmes jumeaux numériques sur deux modèles différents. Ils se contredisaient autant entre eux qu'avec la réalité.

  • Insatisfaits de l'état du pays : 69 % des vraies personnes, 70 % des jumeaux Claude, 100 % des jumeaux GPT.
  • Électeurs de Trump qui l'approuvent « très fortement » : 65 % en réalité, 46 % avec Claude, 88 % avec GPT.
  • Choix d'une option médiane sur les questions à échelle : 45 % des vraies personnes, 56 % des jumeaux Claude, 31 % des jumeaux GPT.

Un modèle rendait tout le monde modéré. L'autre rendait tout le monde extrême. Le résumé de Pew : chaque échantillon synthétique « a dressé un portrait très différent du public américain », et « aucun ne reflétait vraiment l'opinion publique réelle ».

Pour un fondateur, cela signifie que le « marché » décrit par une étude d'utilisateurs synthétiques dépend en partie du modèle que vous utilisez. Changez de modèle, et votre courbe de consentement à payer se déplace.

5. Ce à quoi servent encore les utilisateurs synthétiques

Pew ne dit pas que l'IA est inutile en recherche. Il cite deux usages où elle aide : classer les vraies réponses aux questions ouvertes, et écrire le code d'analyse des résultats. Dans les deux cas, l'IA traite ce que de vraies personnes ont dit au lieu de l'inventer.

Pour les fondateurs, la même règle donne une liste utile :

  1. Rédiger votre guide d'entretien.

    Demandez à un modèle de suggérer des questions, puis supprimez celles qui orientent la réponse. C'est rapide, et rien de ce qu'il produit n'est traité comme une preuve.

  2. Tester vos formulations à l'avance.

    Soumettez votre questionnaire à un modèle pour repérer les questions confuses ou doubles avant que de vraies personnes ne le voient.

  3. Répéter les objections.

    Faites jouer un acheteur sceptique pour vous entraîner à votre pitch. Considérez-le comme un sparring-partner, pas comme une prévision de ce que diront les acheteurs.

  4. Coder les transcriptions.

    Après avoir parlé à de vraies personnes, utilisez un modèle pour étiqueter les thèmes de vos notes. C'est l'usage que Pew approuve.

Ce qu'il ne peut pas faire, c'est vous dire si les gens veulent ce que vous construisez, combien ils sont, ni combien ils paieraient.

6. L'alternative moins chère qui marche

Cinq vraies conversations avec des personnes qui ont le problème vous en apprendront plus que cinq cents conversations synthétiques, parce qu'elles peuvent vous surprendre. Elles peuvent dire « je ne sais pas », « jamais entendu parler » ou « on a réglé ça avec un tableur il y a des années » — exactement les réponses que, selon Pew, l'IA ne donne presque jamais.

Si vous n'avez encore jamais organisé ces conversations, nos guides sur la préparation d'un appel de découverte et sur la transformation de l'intérêt d'une communauté en premier client payant en expliquent le déroulé.

7. Ce que je ne prétendrais pas

Pew a étudié l'opinion publique, pas la demande pour un produit. Les questions portaient sur la politique, l'actualité et les connaissances. J'applique ces schémas à la recherche client parce que le mécanisme est le même, mais Pew n'a pas testé de questions sur des produits.

Deux modèles ont été comparés. Claude Opus 4.6 était le modèle principal, et la comparaison a ajouté GPT-5.1. Le chiffre principal de 12,4 points est la moyenne sur trois enquêtes ; la comparaison entre modèles donne 11,4 points pour Claude et 13,3 pour GPT sur les questions qu'elle couvrait. D'autres modèles, prompts ou méthodes pourraient faire mieux ou moins bien.

De meilleures méthodes pourraient réduire l'écart. Pew le dit lui-même : de nouveaux modèles et de nouvelles façons de construire des échantillons synthétiques pourraient produire des erreurs plus faibles. C'est une mesure de la situation actuelle, pas une limite définitive.

Vos utilisateurs synthétiques reposent sans doute sur moins d'informations. Les jumeaux de Pew ont été construits à partir des propres réponses détaillées de chaque personne. La plupart des personas de fondateurs tiennent en un paragraphe de description. Cela laisse penser que des utilisateurs synthétiques créés par un fondateur feraient pire, mais c'est mon inférence, pas un résultat testé par Pew.

Le bilan, sans détour

Pew a construit la version la plus soignée de répondants synthétiques que la plupart des fondateurs pourraient espérer — des jumeaux IA de vraies personnes, construits à partir de leurs propres réponses — et ils se sont malgré tout trompés d'environ 12 points en moyenne. Ils en savaient plus que les vraies personnes, étaient plus sûrs d'eux, évitaient les extrêmes et répondaient comme le stéréotype de leur groupe. Ils faisaient pire sur les sujets nouveaux. Et changer de modèle changeait le portrait.

Pour une startup, ce ne sont pas des cas marginaux. Ce sont exactement les erreurs qui feraient paraître un produit plus désiré, mieux compris et plus largement attrayant qu'il ne l'est vraiment.

Utilisez l'IA pour préparer vos conversations avec les clients et pour les analyser. Pas pour les remplacer.

Sources : Athena Chapekis, Arnold Lau, Samuel Bestvater, Sono Shah, Andrew Mercer et Aaron Smith, « Can AI stand in for human survey takers? Not really », Pew Research Center, 30 septembre 2026 — la méthode des jumeaux numériques, les trois enquêtes de l'American Trends Panel du début de 2026 et leurs quelque 300 questions, l'erreur moyenne de 12,4 points, la part des questions au-delà de 15 points, les exemples des centres de données, du Premier amendement, de l'OTAN et de la Coupe du monde, l'écart de quatre fois sur « je ne sais pas », les réponses qu'aucun répondant IA n'a choisies, les exemples de stéréotypes et les conclusions de Pew sur ce que l'IA peut et ne peut pas faire. Les mêmes auteurs, « How synthetic polling results change based on the AI model », Pew Research Center, 30 septembre 2026 — la comparaison entre Claude Opus 4.6 et GPT-5.1, les erreurs de 11,4 et 13,3 points, les taux de réponses médianes, les exemples de désaccord entre modèles et la réserve sur les méthodes futures. Les citations sont reproduites ici en traduction. L'application à la recherche client des sections 3 à 6 est la mienne.

IdeaToMVP Academy

Want to build with AI — not just read about it?

4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.

Explore the Academy →
Share this post :