Corpus de veille internationale : deux repères publics pour choisir ses sources par pays
Un rapport annuel sur les usages d'information et un indice de liberté de la presse suffisent à cadrer un corpus pays par pays, sans budget dédié.
À retenir
- Le Digital News Report du Reuters Institute repose sur près de 100 000 répondants dans 48 pays et indique par où l'information circule réellement.
- L'Indice de liberté de la presse de Reporters sans frontières donne le contexte d'exercice, jamais la qualité d'un titre pris isolément.
- Croiser les deux évite le corpus constitué par accrétion, où ne restent que les sources faciles à collecter techniquement.
- Un corpus mal cadré se paie au moment de la synthèse automatisée, quand le modèle comble les manques par des citations inventées.
Constituer un corpus de veille sur un pays que l'on ne pratique pas est un exercice où l'erreur se voit tard. On rassemble une dizaine de titres croisés au fil des recherches, on branche les flux techniquement disponibles, et le dispositif tourne des mois avant que quelqu'un remarque qu'un média très lu n'y figure pas, ou qu'un titre suivi chaque jour n'y pèse presque rien.
Deux publications de référence, gratuites et renouvelées chaque année, réduisent nettement ce risque : un rapport annuel sur les usages d'information et un indice de liberté de la presse. Journalism.co.uk les recense parmi les jeux de données ouverts sur l'industrie des médias, à côté d'autres ressources consultables sans abonnement, dans une liste destinée aux journalistes mais directement transposable au travail de veille.
Ni l'un ni l'autre n'a été conçu pour cadrer un corpus professionnel. C'est précisément ce qui les rend utiles : ils décrivent un paysage médiatique avant tout arbitrage de collecte, donc sans épouser les contraintes techniques du veilleur. Reste à savoir ce que chacun mesure, ce qu'il ignore, et comment les lire l'un avec l'autre sans leur faire dire davantage.
Ce que mesure vraiment un rapport annuel sur les usages d'information
Le repère le plus large sur la consommation d'information est le Digital News Report publié chaque année par le Reuters Institute. Selon Journalism.co.uk, il repose sur près de 100 000 répondants dans 48 pays, ce qui en fait l'une des rares enquêtes comparables d'un marché à l'autre. Sa matière est déclarative : elle décrit ce que des personnes interrogées disent lire, regarder et écouter, pays par pays.
Pour un corpus, cette matière répond à une question précise : par où l'information circule-t-elle réellement dans ce pays. Elle indique quels titres concentrent l'attention, quelle place occupent les plateformes sociales face aux sites de presse, et si l'accès passe davantage par un moteur de recherche, une application ou une messagerie. Un corpus qui ignore le canal dominant d'un pays recueille des textes sans recueillir leur diffusion.
Les limites tiennent au format. Le déclaratif surestime les usages jugés valorisants et sous-estime les autres. L'échantillon est interrogé en ligne, ce qui décale la lecture dans les pays où une partie de la population s'informe hors des réseaux. Enfin, 48 pays laissent de larges zones non couvertes, et rien dans ce rapport ne renseigne sur la qualité d'un titre ni sur son traitement d'un sujet de niche.
L'indice de liberté de la presse, un repère de contexte plus que de qualité
Le second repère est l'Indice de liberté de la presse publié par Reporters sans frontières, que Journalism.co.uk présente comme un classement interactif par pays. Il ne décrit pas des audiences mais des conditions d'exercice : pressions juridiques, sécurité des journalistes, concentration économique, marge de manoeuvre éditoriale. C'est une lecture du cadre dans lequel un média produit son information, pas un jugement porté sur ses articles.
L'usage le plus utile en veille concerne le silence. Dans un pays où la presse travaille sous contrainte, l'absence de couverture d'un événement ne prouve pas que l'événement n'a pas eu lieu : elle reflète parfois le coût de le publier. Le même vide, dans un pays au contexte ouvert, autorise une interprétation bien plus directe. Le repère change donc la façon de lire ce qui manque au corpus.
La confusion à éviter est le glissement du pays vers le titre. Un classement national ne qualifie aucun média en particulier : un pays bien placé abrite des publications ouvertement partisanes, et un pays mal placé conserve des rédactions rigoureuses qui travaillent à leurs risques. Transformer un rang national en note de source produit un tri faux, appliqué avec l'assurance trompeuse du chiffre.
Croiser les deux repères avant d'ouvrir le premier flux
L'ordre des opérations compte. On lit d'abord l'audience pour savoir qui est effectivement lu, puis le contexte pour savoir dans quelles conditions ces titres publient, et seulement ensuite on regarde ce qui est techniquement collectable. Inverser cet ordre, ce qui reste la pratique la plus courante, revient à laisser la disponibilité des flux décider du périmètre d'observation.
L'Observatoire de l'Intelligence Économique relève que la majorité des corpus internationaux se constituent par accrétion : on ajoute une source parce qu'elle est apparue dans une recherche, on ne retire presque jamais, et personne ne consigne le motif d'entrée. Au bout de deux ans, le périmètre reflète l'historique des requêtes menées par une équipe, pas la structure du paysage médiatique observé.
Le croisement rend visibles deux situations opposées. Un pays à forte concentration d'audience et à contexte contraint appelle des sources extérieures : presse régionale des pays voisins, publications de diaspora, rapports d'organisations non gouvernementales. Un pays au contexte ouvert mais à audience très fragmentée demande l'inverse, un élargissement du nombre de titres suivis, faute de quoi le corpus ne capte qu'une fraction du débat.
Une notation de fiabilité ne remplace pas le cadrage du corpus
Un troisième instrument circule beaucoup : la notation de sources. Journalism.co.uk rappelle que NewsGuard évalue plus de 35 000 sources d'information en ligne, représentant plus de 95 % de l'engagement médiatique mesuré. L'échelle est considérable et l'outil répond à une question réelle : cette source respecte-t-elle des pratiques journalistiques élémentaires, signature des articles, correction des erreurs, séparation entre information et publicité.
Des dispositifs plus modestes explorent la même piste. Comme le rapporte franceinfo, la plateforme Logokratia note chaque publication sur la fiabilité, la clarté et la tonalité, et produit un pourcentage appelé logo score ; plus ce score est élevé, plus la publication est mise en avant dans le fil. Le projet a démarré en mai 2025, avec des premières bêtas en septembre 2025 et une application mobile sortie en mars 2026.
La distinction à tenir est simple. Une notation qualifie une source déjà présente dans le dispositif et sert au tri ; le cadrage décide de sa présence et sert au périmètre. Noter finement un corpus incomplet ne le complète pas : cela donne seulement une hiérarchie propre à l'intérieur d'un champ mal délimité, ce qui rend l'angle mort plus difficile à repérer.
Ce qu'un corpus mal cadré coûte au moment de la synthèse automatisée
L'enjeu a changé de nature depuis que des modèles de langage produisent les résumés. Northern Light rappelle que l'hallucination est une propriété du mécanisme de ces modèles, qui génèrent les mots statistiquement probables et non des vérités vérifiées, et qu'il ne s'agit donc pas d'un défaut corrigeable par une consigne de rédaction. Le phénomène s'aggrave exactement là où la veille travaille : concurrents de niche, mouvements récents, sources payantes jamais vues par le modèle.
Les ordres de grandeur cités par Northern Light situent le risque : de 18 % avec GPT-4 à 55 % avec GPT-3.5 des citations générées étaient entièrement inventées, et un audit de la littérature scientifique a signalé environ 147 000 fausses citations produites par l'IA pour la seule année 2025. Un corpus lacunaire alimente directement ce mécanisme, puisque là où la matière manque, le modèle comble.
La réponse décrite par Northern Light est architecturale plutôt que rédactionnelle : ancrer le modèle dans des sources fiables, exiger des citations traçables, tenir ces sources à jour et gouvernées. Sur ce terrain, NewsCore (www.newscore.fr) couvre en continu un périmètre multilingue très large, trie les signaux pertinents et relie chaque synthèse à son document d'origine, ce qui rend le corpus vérifiable à la ligne près.
Un corpus n'est pas une liste de flux disponibles : c'est une hypothèse sur l'endroit où l'information apparaît, et une hypothèse se vérifie.
Tenir le corpus à jour entre deux éditions annuelles
Les deux repères paraissent une fois par an, la veille tourne tous les jours. Entre deux éditions, un titre change d'actionnaire, un site est bloqué dans son pays, une rédaction ferme ou fusionne, une plateforme perd l'audience qui faisait sa valeur. Le cadrage annuel donne une photographie solide, il ne dispense pas de suivre les mouvements qui la périment en cours d'année.
La pratique qui tient dans la durée est peu coûteuse : un journal des décisions de corpus, tenu à côté du dispositif. Chaque entrée porte la date, la source ajoutée ou retirée, le motif, et le repère qui a servi à trancher. Ce document règle la question la plus fréquente en réunion, celle de savoir pourquoi tel média figure au périmètre et tel autre non.
La revue se cale ensuite sur la parution des deux publications, complétée par des ajustements ponctuels dès qu'un événement le justifie. Sans ce rendez-vous, la dérive est mécanique : le corpus vieillit au rythme des départs dans l'équipe, et les arbitrages initiaux se perdent avec les personnes qui les avaient faits, laissant une liste de flux que plus personne ne sait justifier.
Questions fréquentes sur le cadrage d'un corpus international
Ces deux repères sont-ils payants ?
Non. Le rapport annuel sur les usages d'information et l'indice de liberté de la presse sont publiés en accès libre et se consultent en ligne. Journalism.co.uk les recense d'ailleurs dans une liste de sources de données gratuites sur l'industrie des médias, ce qui les rend accessibles à une équipe dépourvue de budget d'étude.
Comment cadrer un corpus dans un pays absent du rapport annuel ?
Le rapport couvre 48 pays, ce qui laisse de nombreuses zones hors périmètre. Pour ces pays, l'indice de liberté de la presse reste disponible et donne le contexte d'exercice. Il se complète par les corpus déjà constitués sur les pays voisins, les publications de diaspora et les rapports d'organisations internationales présentes sur place.
Un score de fiabilité suffit-il à sélectionner ses sources ?
Non, parce qu'un score s'applique aux sources déjà retenues. Il ordonne un champ, il ne le délimite pas. Une équipe qui note finement un corpus amputé de la presse la plus lue d'un pays obtient un classement soigné sur un périmètre faux, et cette apparence de rigueur retarde la découverte du manque.
À quelle fréquence faut-il revoir un corpus international ?
Une revue complète par an, calée sur la parution des deux repères, suffit dans la plupart des dispositifs. Elle se double de révisions ponctuelles à chaque événement qui modifie le paysage : rachat d'un titre, blocage d'un site, fermeture d'une rédaction, apparition d'une plateforme qui capte rapidement l'audience.