Une audience simulée par IA, ou audience synthétique, est un panel de profils générés par un modèle de langage qui réagissent à une question, un produit ou une décision comme le feraient des personnes interrogées.
Une audience simulée par IA, ou audience synthétique, est un panel de profils générés par un modèle de langage qui réagissent à une question, un produit ou une décision comme le feraient des personnes interrogées. Personne n'est interrogé : les réponses sortent du modèle, ancrées ou non dans des données réelles. L'idée fondatrice, le silicon sampling, date d'Argyle et al. (Political Analysis, 2023) : un modèle conditionné sur des profils réels peut approcher les distributions de réponses de sous-groupes humains. Le marché qui en descend est jeune et financé : Simile a levé 100 M$, Aaru plus de 50 M$, et la plupart des acteurs revendiquent 80 à 95 % d'exactitude, auto-déclaré et jamais audité par un examen public reproductible. La recherche évaluée mesure autre chose : sur un panel synthétique aux moyennes correctes, 48 % des relations statistiques diffèrent du réel, dont 32 % à signe inversé (Bisbee et al., Political Analysis 2024), et l'erreur face à un vrai sondage va de 4 à plus de 23 points selon le sujet (rapports Verasight, 2025-2026). Le Pew Research Center, institut de référence du sondage, refuse le silicon sampling et n'interroge que de vraies personnes (2026). La thèse de cette page tient en deux phrases. Le marché court vers le faux chiffre exact : un pourcentage d'opinion sorti d'un panel simulé rassure et se vend, mais la carte des opinions qui le compose est fausse presque une fois sur deux. La valeur honnête est ailleurs : explorer l'éventail des réactions plausibles à une décision, les objections, les lignes de fracture, avant que le réel ne réponde. Cette page cartographie le sujet : trois familles d'acteurs, cinq concepts, trois débats, dix questions. Elle est écrite par Kapari, un acteur de ce marché qui a choisi l'exploration et le dit : son banc d'essai des décisions n'est ni un sondage, ni une mesure d'opinion, ni une prédiction.
Le marché des audiences simulées par IA se range en trois familles. La première vend du sondage synthétique : un panel de répondants générés qui promet un pourcentage d'opinion, au prix et au délai d'une requête. La deuxième construit des jumeaux numériques de clients (et, pour le geste appliqué à une décision entière, le jumeau numérique de décision) à partir des données de l'entreprise, interrogeables à volonté pour tester un produit ou un message. La troisième, celle de Kapari, est le banc d'essai de décisions : un panel simulé réagit à une décision précise pour en faire surgir les objections et les lignes de fracture avant l'annonce, sans chiffre d'opinion. Les deux premières familles s'achètent dans les équipes marketing, produit et études, qui cherchent la vitesse ; la troisième, dans le bureau du dirigeant et de son comité, pour voir les objections avant d'annoncer. Le marché est jeune et financé : Simile a levé 100 M$ et Aaru plus de 50 M$, pendant que la plupart des acteurs revendiquent 80 à 95 % d'exactitude, auto-déclaré et jamais audité par un examen public reproductible. Le régulateur a commencé à trier : la FTC a sanctionné Workado en 2025 pour allégation d'exactitude non étayée, produit retombé autour de 74 % une fois testé. Un marché qui lève de telles sommes et prouve si peu se cherche encore : le vendeur y court vers le chiffre exact, l'acheteur y gagne à exiger la méthode.
L'échantillonnage de répondants simulés, ou silicon sampling, est la technique qui remplace les répondants humains d'une étude par des personnages générés par un modèle de langage : on décrit un profil au modèle, puis on lui pose la question comme à une personne. Le papier fondateur (Argyle et al., Political Analysis 2023) montre qu'un modèle conditionné sur des profils réels peut approcher les distributions de réponses de sous-groupes humains. Toute l'offre du marché descend de cette idée, et de sa limite : ce que la machine restitue est ce que ses données d'entraînement disent de ces profils, pas ce que de vraies personnes répondraient aujourd'hui.
C'est le mot qui ouvre la littérature scientifique et les argumentaires commerciaux, et c'est celui que rejette l'institut de référence du sondage : le Pew Research Center refuse le silicon sampling et n'interroge que de vraies personnes (2026). Connaître l'origine de la technique permet de demander à un vendeur ce qu'il a ajouté, ou pas, au papier fondateur.
Source : Argyle et al., « Out of One, Many », Political Analysis, 2023 ; Pew Research Center, 2026.
Le lissage est la tendance d'un modèle de langage à ramener les voix qu'il simule vers une opinion moyenne : les minorités et les positions tranchées disparaissent de la photographie (Santurkar et al., ICML 2023 ; Wang, Nature Machine Intelligence 2025). Le piège va plus loin que la moyenne : sur un panel synthétique aux moyennes correctes, 48 % des relations statistiques diffèrent du réel, dont 32 % à signe inversé (Bisbee et al., Political Analysis 2024). Une moyenne juste peut donc habiller une carte fausse : qui pense quoi, et pourquoi, se dérobe pendant que le total rassure.
C'est le piège d'achat numéro un, et le résultat le plus contre-intuitif du domaine. Un acheteur qui valide un outil sur ses seules moyennes ne verra rien, et sa conclusion peut se retourner. La fidélité algorithmique, la capacité d'un modèle à restituer les réponses d'un groupe donné, se juge sur la structure des réponses, jamais sur le total.
Source : Santurkar et al., ICML 2023 ; Wang, Nature Machine Intelligence, 2025 ; Bisbee et al., Political Analysis, 2024.
Un persona générique est un profil que le modèle complète d'imagination à partir d'une étiquette (« femme, 45 ans, cadre ») ; un profil ancré s'appuie sur des données réelles : interviews, études publiées, sources qu'un tiers peut consulter. Stanford a mesuré les deux bouts de l'échelle : un agent construit sur 2 h d'interview d'une personne réelle retrouve 85 % de ses réponses au General Social Survey re-posé (Park et al., 2024, sur 1 000 personnes), quand les agents bâtis sur de simples descriptions démographiques ressortent plus biaisés et plus stéréotypés.
« D'où viennent vos profils » est la première question à poser à un fournisseur : elle sépare l'outil qui invente ses répondants de celui qui les documente. Et le 85 % vaut pour la fidélité d'un individu interviewé deux heures ; il ne se transpose pas à un panel qui simule les parties prenantes d'une décision, que personne n'a interviewées.
Source : Park et al., « Generative Agent Simulations of 1,000 People », Stanford, 2024.
L'éventail de réactions est une restitution qui montre la répartition des réactions plausibles, les camps qui se forment et les objections qui reviennent, là où le chiffre unique compresse tout en un pourcentage d'adhésion. Il assume ce que le chiffre unique masque : face à un vrai sondage, l'erreur d'un panel LLM va de 4 à plus de 23 points selon le sujet (rapports Verasight, 2025-2026).
C'est la ligne de partage des promesses du marché. L'outil qui rend un chiffre unique se juge comme un instrument de mesure, et la littérature dit qu'il échoue à ce jeu ; l'outil qui rend un éventail se juge sur la qualité de son exploration. Savoir laquelle des deux promesses on achète évite de payer une mesure qui n'en est pas une.Notre page sur le refus du chiffre unique explique pourquoi Kapari a choisi l'éventail.
Source : Rapports Verasight, 2025-2026.
Un verdict calculé sort de règles fixes appliquées aux réponses du panel : même dossier, même verdict, rejouable devant un tiers. Un verdict généré est un texte rédigé par le modèle de langage lui-même, différent d'une exécution à l'autre. La science de la décision connaît ce clivage depuis longtemps : une règle simple appliquée avec constance tient tête à l'expert au cas par cas, parce qu'elle ne fatigue pas et ne change pas d'humeur (Meehl, 1954 ; Dawes, American Psychologist, 1979), deux travaux présentés sur notre page des théories de la décision qui font tourner le moteur.
La rejouabilité est le seul contrôle que l'acheteur peut exercer seul : sans elle, aucun examen public n'est possible, et toute exactitude annoncée reste une déclaration. Devant deux outils, demander lequel rend deux fois le même verdict sur le même dossier départage plus vite que n'importe quelle plaquette.
Source : Meehl, « Clinical versus Statistical Prediction », 1954 ; Dawes, American Psychologist, 1979.
Le camp du remplacement avance trois arguments sérieux. Le coût et la vitesse, d'abord : un panel simulé met l'étude à la portée de décisions qui n'en avaient jamais eu. Le résultat fondateur, ensuite : chez Argyle et al. (Political Analysis 2023), un modèle conditionné sur des profils réels approche les distributions de réponses de sous-groupes humains. Le pari d'ingénieur, enfin : les modèles progressent vite, l'écart avec le terrain se comblera. Le camp de l'exploration répond par la mesure : sur un panel synthétique aux moyennes correctes, 48 % des relations statistiques diffèrent du réel, dont 32 % à signe inversé (Bisbee et al., Political Analysis 2024) ; face à un vrai sondage, l'erreur va de 4 à plus de 23 points selon le sujet, et les croisements de sous-groupes sont quasi inutilisables (rapports Verasight, 2025-2026). Une moyenne juste ne suffit pas quand la carte des opinions qui la compose est fausse. Ce que dit la littérature évaluée n'est pas « c'est nul », c'est « ce n'est pas une mesure » : fragile comme substitut chiffré d'un sondage, défendable comme outil d'exploration des réactions plausibles. Le Pew Research Center en a tiré la conséquence pour son propre métier : il refuse le silicon sampling et n'interroge que de vraies personnes (2026). Le fond de ce débat est traité dans notre réponse sourcée sur la fiabilité des audiences synthétiques ; ce paragraphe le résume sans le répéter. La position de Kapari tient en une phrase : son banc d'essai des décisions a choisi l'exploration, il montre l'éventail des réactions plausibles avant d'annoncer, et il n'est ni un sondage, ni une mesure d'opinion, ni une prédiction.
Le camp du score plaide l'usage : un acheteur a besoin d'un repère simple pour comparer des outils, un score interne construit sérieusement vaut mieux qu'aucune information, et exiger un audit externe d'un marché naissant reviendrait à geler l'innovation avant qu'elle ait fait ses preuves.
Le camp de la méthode répond qu'un chiffre invérifiable ne renseigne pas, il rassure : la plupart des acteurs revendiquent 80 à 95 % d'exactitude, auto-déclaré et jamais audité par un examen public reproductible. Et quand quelqu'un teste, l'écart se voit : la FTC a sanctionné Workado en 2025 pour allégation d'exactitude non étayée, et le produit est retombé autour de 74 % une fois testé.
Ce que disent les faits publics : il n'existe pas d'audit tiers standard du secteur, et le précédent FTC (2025) est le seul point de comparaison public entre un chiffre affiché et un chiffre testé. Bisbee et al. (Political Analysis 2024) donnent la raison de fond : un score global peut sembler exact pendant que 48 % des relations statistiques du panel diffèrent du réel. Un pourcentage d'exactitude est une réponse trop courte à une question qui en demande trois : exact sur quoi, mesuré comment, vérifiable par qui.
La position de Kapari : refuser le concours de pourcentages et défendre un seul critère, la méthode est-elle publiée et rejouable par un tiers ;il se l'applique avec un examen public contre le réel dont chaque copie est affichée, la pire comprise.
Le camp critique tient la position la plus documentée : les modèles écrasent les minorités et les positions extrêmes vers une opinion moyenne (Santurkar et al., ICML 2023 ; Wang, Nature Machine Intelligence 2025), et les agents construits sur de simples descriptions démographiques sont plus biaisés et plus stéréotypés que les agents adossés à des interviews (Park et al., Stanford, 2024). Simuler « une femme de 45 ans, cadre » reviendrait alors à animer un cliché, et à le faire parler au nom de personnes réelles.
Le camp de l'ancrage répond que le stéréotype est un défaut de construction, pas une fatalité : la même étude Stanford montre que l'ancrage dans des données réelles réduit les biais entre groupes, et un outil peut refuser de simuler des individus pour ne travailler que sur des types documentés, limites écrites à l'écran. Le problème n'est pas de simuler, c'est de simuler depuis rien.
Ce que dit la littérature : les deux camps citent les mêmes travaux et n'en tirent pas la même règle. Le point établi : sans ancrage dans des données réelles, la simulation d'un groupe humain dérive vers son cliché, et la dérive frappe d'abord les minorités. L'ancrage atténue le défaut sans l'annuler.
La position de Kapari : prendre la critique au sérieux, chaque voix de ses panels est ancrée dans des sources publiées et vérifiées, aucune voix ne prétend répliquer une personne réelle, et ses limites sont écrites à l'écran.
Une audience simulée par IA, ou audience synthétique, est un panel de profils générés par un modèle de langage qui réagissent à une question, un produit ou une décision comme le feraient des personnes interrogées. Personne n'est interrogé : les réponses sortent du modèle, ancrées ou non dans des données réelles. Le concept fondateur, le silicon sampling, date d'Argyle et al. (Political Analysis 2023). Trois familles d'outils en descendent : le sondage synthétique, le jumeau numérique de clients et le banc d'essai de décisions. La différence entre elles tient à la promesse : mesurer une opinion, répliquer un client, ou explorer les réactions à une décision.
Tout part des profils : soit le modèle les complète d'imagination à partir d'une étiquette démographique (persona générique), soit ils sont ancrés dans des données réelles, interviews ou sources publiées qu'un tiers peut consulter. La différence se mesure : à Stanford, les agents bâtis sur de simples descriptions démographiques ressortent plus biaisés et plus stéréotypés que les agents adossés à des interviews de personnes réelles (Park et al., 2024). La construction des profils décide de la valeur du panel : avant de comparer des tailles ou des prix, demander au fournisseur d'où viennent les siens.
Explorer. Un panel simulé fait apparaître, avant une annonce, l'éventail des réactions plausibles à une décision : les objections, les lignes de fracture entre groupes, les angles morts qu'aucune voix ne défend, tout ce qu'une réunion polie laisse sous la table. Sur ce terrain, l'outil est utile à condition de ne prétendre ni mesurer une opinion ni prédire un résultat : il prépare la décision avant que le réel ne réponde. Ce travail structuré diffère d'une conversation libre avec un assistant :notre comparatif entre panel simulé et chatbot détaille l'écart.
Mesurer. Sur un panel synthétique aux moyennes correctes, 48 % des relations statistiques diffèrent du réel, dont 32 % à signe inversé (Bisbee et al., Political Analysis 2024). Face à un vrai sondage, l'erreur va de 4 à plus de 23 points selon le sujet, et les croisements de sous-groupes fins sont jugés quasi inutilisables (rapports Verasight, 2025-2026). Un pourcentage sorti d'un panel simulé n'est pas une donnée, c'est une hypothèse : le traiter comme une mesure, c'est décider sur un thermomètre qui n'a jamais été étalonné. La règle d'usage en découle : tout ce qui exige un chiffre d'opinion opposable, part de marché, intention de vote, score de satisfaction, relève de vraies personnes interrogées, pas d'un panel simulé.
La taille ne rachète rien : multiplier les voix d'un même modèle n'ajoute pas d'information, le lissage les ramène vers la moyenne (Santurkar et al., ICML 2023). Ce qui compte est la couverture des camps, l'enseignement que Tetlock tire de vingt ans de mesure des jugements d'experts : la diversité des angles protège mieux du faux pas que la profondeur d'une seule expertise (Expert Political Judgment, 2005). Une trentaine de voix contrastées, chacune ancrée dans un profil documenté, couvrent une décision mieux que trois experts d'accord entre eux ;notre page sur la taille du panel déroule ce raisonnement jusqu'au bout.
En exigeant la méthode, pas le chiffre. Trois questions suffisent : l'examen est-il public et rejouable par un tiers ; les cas de test ont-ils servi à calibrer l'outil ; les mauvaises notes sont-elles publiées avec les bonnes. La plupart des acteurs revendiquent 80 à 95 % d'exactitude, auto-déclaré et jamais audité par un examen public reproductible. Le précédent existe : la FTC a sanctionné Workado en 2025 pour une allégation d'exactitude non étayée, et le produit testé est retombé autour de 74 %. Un fournisseur qui refuse ces trois questions a répondu.
Quatre drapeaux : un pourcentage d'exactitude sans méthode publiée ; une promesse de prédire un comportement ou un résultat ; des croisements de sous-groupes fins vendus comme fiables, alors que les rapports Verasight (2025-2026) les jugent quasi inutilisables ; et l'absence de toute limite écrite à l'écran. Un fournisseur sérieux dit ce que son outil ne sait pas faire ; un pourcentage d'exactitude affiché sans méthode vérifiable relève de la classe d'allégations que la FTC a sanctionnée chez Workado en 2025.
Cela dépend de la famille d'outils. Un panel de profils simulés n'exige aucune donnée personnelle de vos clients : les voix sont générées, personne n'est interrogé. Les jumeaux numériques de clients, eux, se construisent sur les données de l'entreprise, ce qui déplace la question vers le droit des données. Dans tous les cas, le risque se loge dans ce que vous versez à l'outil : la décision décrite, les documents joints, le contexte confidentiel. Trois questions au fournisseur avant signature : où sont conservés les textes soumis, servent-ils à entraîner ses modèles, et qui peut les lire ?
L'écart de coût et de délai est l'argument central du marché, et il est réel : un panel simulé se lance le jour même, sans recrutement de répondants ni terrain à organiser. Aucun chiffre standard ne fait foi, chaque fournisseur annonce le sien. Le bon calcul est donc séquentiel : simuler pour préparer, repérer les objections et affûter les questions, puis mesurer sur de vraies personnes quand l'enjeu l'exige. L'un prépare, l'autre tranche.
L'étude (Park et al., Stanford, 2024) a interviewé 1 000 personnes réelles pendant 2 h chacune et construit un agent par interview ; chaque agent retrouve 85 % des réponses de sa propre personne au General Social Survey re-posé. C'est une fidélité individuelle, obtenue par interviews : elle ne se transpose pas à un panel qui simule les parties prenantes d'une décision, que personne n'a interviewées. Quand un argumentaire commercial cite ce chiffre, demander si la méthode du fournisseur repose elle aussi sur des interviews réelles ; si la réponse est non, le chiffre appartient à Stanford, pas au produit.
La carte lue, reste l'instrument : passez une vraie décision au banc d'essai des décisions, gratuitement, et lisez l'éventail des réactions avant d'annoncer.
Cette carte du marché est écrite par Kapari, un acteur de ce marché : chaque chiffre y porte sa source dans la phrase, ses limites y sont écrites au même endroit que celles des autres, et son panel reste ce qu'il est, des voix simulées qui n'interrogent personne, ne mesurent aucune population réelle et ne prédisent rien ; jugez-nous avec les questions de cette page.
Essayez la démo sur une décision d'entreprise, sans créer de compte : 60 secondes suffisent pour voir si ça vous parle.
Kapari mesure son audience avec Google Analytics, pour savoir combien de personnes lisent ces pages. Rien n'est déposé sur votre appareil tant que vous n'avez pas accepté.