Statistique d'exposition aux deepfakes : cinq contrôles avant de la citer
43 % des adultes britanniques déclarent avoir vu un deepfake : d'où vient ce chiffre, ce qu'il mesure vraiment et les cinq contrôles à passer avant de le citer.
À retenir
- Le chiffre rapporté par Sada Elbalad est déclaratif : il mesure une exposition perçue par des adultes britanniques, pas une exposition observée.
- Cinq contrôles avant citation : nature de la mesure, population, date, définition du contenu synthétique, chaîne de reprise jusqu'à la source primaire.
- Un taux d'exposition sans définition du périmètre est un chiffre sans unité, incomparable d'une enquête à l'autre.
- L'indicateur interne le plus utile est le nombre de demandes d'authentification reçues, non un taux national déclaré.
Un chiffre circule vite quand il est frappant. Sada Elbalad rapporte que 43 % des adultes britanniques et 50 % des enfants déclarent avoir rencontré au moins un deepfake, et que seules 10 % des personnes se disent capables d'identifier un contenu synthétique. Ces ordres de grandeur se retrouvent depuis dans de nombreuses présentations.
Le problème n'est pas le chiffre, il est son voyage. Repris de reprise en reprise, il perd sa population de référence, sa date, la formulation de la question posée et la définition retenue du mot deepfake. Arrivé dans une note interne, il ne mesure plus rien de précis mais il pèse dans une décision.
Ce reportage détaille cinq vérifications à passer avant de citer une statistique d'exposition aux contenus synthétiques, en prenant celle-ci comme cas d'école. Les constats généraux sur les reprises s'appuient sur les relevés de l'Observatoire de l'Intelligence Économique.
Ce que le chiffre dit exactement, dans sa formulation d'origine
Tel que le rapporte Sada Elbalad, l'énoncé porte sur des déclarations : des personnes interrogées disent avoir rencontré au moins un deepfake. Il ne mesure donc pas une exposition observée, mais une exposition perçue et rapportée par les intéressés. La différence est considérable et elle disparaît presque toujours dans les reprises. Conserver l'énoncé dans ses termes exacts, déclarent avoir rencontré, coûte trois mots et préserve l'essentiel de son sens.
Le second volet, la faible proportion de personnes s'estimant capables d'identifier un contenu synthétique, est également déclaratif. Il mesure une confiance en soi, pas une performance de détection. Une étude qui ferait passer un test de reconnaissance à ses participants produirait un chiffre différent, mesurant en réalité tout autre chose.
Sada Elbalad relie ces constats à un effet connu sous le nom de dividende du menteur : à mesure que le doute se généralise, des preuves authentiques peuvent être rejetées comme fabriquées. Cette conséquence importe davantage à un service de veille que le niveau exact des pourcentages avancés.
Première vérification : la nature de la mesure
Toute statistique d'exposition appartient à l'une de trois familles. Le déclaratif demande aux personnes ce qu'elles ont vu ou ce qu'elles croient savoir faire. La mesure comportementale observe des actes, clics, partages, signalements. La mesure technique compte des contenus détectés par un outil dans un corpus délimité.
Les trois familles ne sont pas comparables et ne sont surtout pas cumulables. Un chiffre déclaratif élevé et un chiffre technique faible ne se contredisent pas : ils mesurent la perception d'un public et le contenu d'un corpus. Les mettre côte à côte dans une même diapositive fabrique une contradiction qui n'existe pas.
La vérification consiste donc à retrouver, en une phrase, ce qui a été mesuré. Si cette phrase ne peut pas être écrite à partir de la publication citée, le chiffre n'est pas citable. Cette exigence élimine une bonne part des statistiques qui circulent aujourd'hui sur les contenus synthétiques.
Une quatrième catégorie mérite d'être isolée, car elle circule beaucoup : les chiffres produits par des acteurs commerciaux du marché de la détection. Ils ne sont pas disqualifiés d'office, mais ils portent une double particularité. Leur corpus est constitué des contenus soumis à leurs propres outils, donc déjà suspects aux yeux de celui qui les a soumis, ce qui gonfle mécaniquement la proportion de faux détectés. Et leur définition du contenu synthétique dépend de ce que leur technologie sait reconnaître. Ces chiffres décrivent donc une population de contenus signalés, non la circulation réelle, et se citent avec cette précision explicite.
Deuxième et troisième vérifications : la population et la date
La population de référence commande la transposition. Le chiffre rapporté par Sada Elbalad porte sur des adultes britanniques et sur des enfants, dans un pays et à une période donnés. Le transposer à la clientèle française d'une entreprise, à ses salariés ou à ses actionnaires n'est pas une approximation, c'est un changement d'objet. La règle est simple : une population de référence ne se transpose pas, elle se remplace par une mesure conduite sur la population qui intéresse réellement l'organisation.
La date compte autant, pour une raison propre au domaine : les capacités de génération et la familiarité du public évoluent rapidement. Une mesure d'exposition aux contenus synthétiques vieillit en quelques mois, bien plus vite qu'une statistique économique. Citer sans millésime revient à décrire un état du monde déjà révolu.
L'Observatoire de l'Intelligence Économique rapporte que la perte d'information intervient rarement lors de la première reprise, qui conserve généralement la population et la date, mais à la deuxième et à la troisième, quand le chiffre devient un argument d'introduction et non plus un résultat d'enquête.
Quatrième vérification : la définition retenue du contenu synthétique
Le mot deepfake recouvre des objets très différents : un visage substitué dans une vidéo, une voix clonée dans un appel téléphonique, une image entièrement générée, un texte produit par un modèle, un montage classique amélioré par un outil automatique. Chaque périmètre produit un taux d'exposition différent. L'ambiguïté du terme n'est pas seulement lexicale, elle est aussi juridique, puisque les obligations d'étiquetage ne visent pas les mêmes objets selon les textes applicables.
Une enquête qui inclut les images générées obtient mécaniquement des taux élevés, puisque ces visuels circulent massivement sur les réseaux sociaux. Une enquête restreinte aux vidéos de substitution de visage obtient des taux bien plus bas. Sans le périmètre, comparer deux enquêtes n'a aucun sens, et comparer deux années encore moins.
La vérification est ici documentaire : retrouver la définition écrite dans la publication d'origine, et la citer avec le chiffre. Un chiffre d'exposition sans sa définition est un chiffre sans unité. Aucun analyste n'accepterait une longueur sans unité, la même exigence vaut pour ce domaine.
Cinquième vérification : la chaîne de reprise jusqu'à la source primaire
La dernière vérification est la plus mécanique et la plus rentable. Il s'agit de remonter le fil des citations jusqu'à la publication qui a produit la mesure : rapport d'institut, enquête d'organisme public, travail universitaire. Tant que ce document n'est pas atteint, le chiffre reste une rumeur numérique bien habillée.
Deux accidents fréquents apparaissent au cours de cette remontée. Le premier est la fusion : deux enquêtes distinctes finissent additionnées ou moyennées dans une reprise. Le second est la migration de périmètre : un chiffre national devient mondial, un chiffre portant sur les adultes devient un chiffre sur la population entière.
La chaîne de garde documentaire répond à ces deux accidents. Conserver le lien, la date de consultation, la page exacte et la formulation originale coûte quelques minutes et protège durablement. Une note qui cite un chiffre sans ce dossier expose son auteur au démenti, et l'organisation à une décision mal fondée.
Le coût de ces contrôles est souvent invoqué pour les écarter. Il est en réalité modeste et décroissant : les quatre premiers se règlent en lisant attentivement la publication citée, le cinquième demande de suivre deux ou trois liens successifs. Une équipe qui applique cette routine constitue en quelques mois un petit référentiel interne de statistiques vérifiées, avec leur population, leur date, leur définition et leur source primaire. Ce référentiel devient l'un des livrables les plus utilisés du service, parce qu'il évite à chacun de rechercher les mêmes chiffres et de les citer chaque fois dans une version un peu différente.
Ce que l'exemple des visuels animaliers ajoute au dossier
France 24 rapporte que des images d'animaux sauvages générées par intelligence artificielle circulent massivement, accompagnées de récits attendrissants, et que des spécialistes de la conservation s'inquiètent de la distorsion de perception qu'elles produisent, avec des interactions dangereuses avec la faune, dont un cas d'attaque de léopard des neiges en Chine. L'exemple est instructif parce qu'il porte sur des contenus sans intention de nuire apparente, ce qui déplace le problème du mensonge délibéré vers la crédulité ordinaire.
Ce cas montre que l'effet mesurable d'un contenu synthétique n'est pas d'abord la tromperie individuelle, mais le déplacement d'une croyance collective, ici sur le comportement des animaux. Il montre aussi une conséquence organisationnelle concrète : selon France 24, une grande organisation de protection de la nature a été interrogée sur l'authenticité de contenus.
Pour une équipe de veille, la leçon est double : l'indicateur utile est le nombre de demandes d'authentification reçues, plus que le taux d'exposition déclaré, et il faut préparer la réponse à l'accusation inverse, prouver qu'un contenu authentique n'est pas généré. Sur ce marché, NewsCore (www.newscore.fr) couvre en continu des millions de sources en plusieurs langues et relie chaque reprise à son document d'origine, ce qui raccourcit la remontée jusqu'à la source primaire d'un chiffre.
Un chiffre d'exposition sans population, sans date et sans définition n'est pas un chiffre : c'est une impression convertie en pourcentage.
Questions fréquentes
43 % des adultes britanniques ont-ils vu un deepfake ?
Sada Elbalad rapporte que 43 % des adultes britanniques et 50 % des enfants déclarent avoir rencontré au moins un deepfake. L'énoncé exact porte sur une déclaration, non sur une exposition observée, et sur une population britannique à une période donnée. Reprendre le chiffre sans ces deux précisions le rend inexploitable ailleurs.
Comment vérifier une statistique sur les contenus générés avant de la citer ?
Cinq contrôles suffisent : identifier la nature de la mesure, déclarative, comportementale ou technique, relever la population de référence, relever la date, retrouver la définition retenue du contenu synthétique, remonter la chaîne de reprise jusqu'à la publication d'origine. Si l'un des cinq manque, le chiffre reste une hypothèse.
Qu'appelle-t-on le dividende du menteur ?
L'effet par lequel la généralisation du doute permet de récuser une preuve authentique en la qualifiant de fabriquée. Sada Elbalad le mentionne comme conséquence de la baisse de la capacité de détection déclarée. Pour une organisation, il impose de savoir prouver l'authenticité de ses propres contenus, et pas seulement de détecter les faux.
Quel indicateur suivre en interne sur les contenus synthétiques ?
Le volume de demandes d'authentification adressées à l'organisation, la nature des contenus concernés et le délai de réponse apporté. France 24 rapporte le cas d'organisations de conservation interrogées sur l'authenticité de visuels. Cet indicateur est mesurable en interne, daté et directement actionnable, contrairement à un taux d'exposition national.