mercredi 7 octobre 2026
Réglementation

Numérisation destructrice de livres : la question de droit que pose la fabrique des corpus d'IA

Des livres imprimés sont numérisés puis détruits pour alimenter des corpus d'entraînement. Ce que ce procédé révèle du régime juridique des données et de la traçabilité des sources.

La rédaction20 août 20269 min de lecture

À retenir

  • La Presse rapporte que des exemplaires imprimés sont numérisés puis détruits pour constituer des corpus d'entraînement de modèles d'intelligence artificielle.
  • L'Association nationale des éditeurs de livres dénonce une appropriation des idées des auteurs sans crédit ni rémunération, dans un vide juridique.
  • Le procédé déplace le débat de la copie vers la trace : détruire l'exemplaire source complique la reconstitution de la chaîne de garde d'un corpus.
  • Pour les équipes de veille, la question devient un critère de sélection d'outils : savoir sur quoi un modèle a été entraîné conditionne la confiance accordée à ses sorties.

L'entraînement des modèles d'intelligence artificielle a longtemps été discuté sous l'angle du texte disponible en ligne : pages web moissonnées, articles de presse, forums, code source. Une pratique moins commentée mérite pourtant l'attention des professionnels de l'information, parce qu'elle touche à la matière première la plus ancienne du secteur documentaire, le livre imprimé, et parce qu'elle en modifie physiquement le sort.

La Presse rapporte que des exemplaires imprimés sont numérisés puis détruits afin de constituer des corpus d'entraînement pour des modèles d'intelligence artificielle. L'Association nationale des éditeurs de livres, l'ANEL, y dénonce une appropriation des idées des auteurs sans crédit ni rémunération, dans un contexte qu'elle décrit comme un vide juridique. Le procédé technique est banal, le geste qui l'accompagne l'est beaucoup moins.

Cette affaire dépasse le débat sur la rémunération des ayants droit, qui est réel mais déjà largement documenté. Elle pose une question de méthode qui intéresse directement les professionnels de la veille : que devient la traçabilité d'un corpus quand la source physique dont il est issu n'existe plus ? Cet article examine cette question, ses implications juridiques et ce qu'elle change dans le choix des outils d'analyse.

Ce que la numérisation destructrice change par rapport au moissonnage classique

La numérisation à plat d'un ouvrage relié est lente et abîme la reliure. La numérisation dite destructrice consiste à sectionner le dos du livre pour en séparer les feuillets, qui passent ensuite dans un chargeur automatique. Le gain de vitesse est considérable, la qualité de capture est supérieure, et l'exemplaire ne survit pas à l'opération. La technique est ancienne et employée depuis longtemps par des bibliothèques pour des fonds abîmés.

Le changement d'échelle et de finalité modifie l'appréciation. Numériser un fonds fragile pour le préserver et le rendre consultable relève d'une mission de conservation, généralement encadrée par des conventions avec les ayants droit. Acquérir des exemplaires neufs dans le seul but de les convertir en données d'entraînement puis de les détruire relève d'une autre logique, où le livre n'est plus un objet culturel mais une matière première consommable.

Sur le plan du droit d'auteur, l'achat légal d'un exemplaire n'emporte pas le droit d'en exploiter le contenu par reproduction et par extraction massive. C'est précisément le point de friction relevé par l'ANEL dans les propos rapportés par La Presse : l'appropriation porte sur le contenu et sur les idées qui y sont exprimées, sans crédit ni rémunération pour ceux qui les ont produites, alors même que l'achat de l'objet est parfaitement régulier.

Le vide juridique invoqué et les régimes qui s'en approchent

L'expression de vide juridique doit être maniée avec prudence, car plusieurs régimes existent sans traiter précisément cette hypothèse. Le droit d'auteur protège l'expression d'une œuvre et non les idées qu'elle contient, ce qui complique une action fondée sur la seule reprise conceptuelle. Les exceptions de fouille de textes et de données, introduites en Europe, autorisent certaines extractions à des fins de recherche, avec des conditions et des possibilités d'opposition.

Le point aveugle se situe dans l'articulation entre ces briques. Un acteur qui acquiert légalement des exemplaires, les numérise pour son usage interne et n'en redistribue aucun extrait identifiable se place dans une zone où la caractérisation de l'atteinte devient difficile. La question de savoir si l'entraînement constitue en lui-même un acte de reproduction relevant du monopole de l'auteur fait l'objet de positions divergentes selon les juridictions.

Pour une équipe de veille juridique, ce dossier est un cas d'école de suivi réglementaire. Les évolutions viendront de plusieurs sources parallèles : décisions judiciaires nationales, positions d'autorités administratives, accords contractuels entre éditeurs et développeurs de modèles, et travaux législatifs. Suivre un seul de ces canaux revient à découvrir la solution une fois qu'elle est déjà appliquée, ce qui est le contraire d'une veille utile.

La destruction de la source et la question de la chaîne de garde

La chaîne de garde est un concept familier aux praticiens de l'OSINT et de l'investigation : elle désigne la capacité à retracer, pour chaque élément, son origine, sa date de collecte, sa forme initiale et les transformations qu'il a subies. Elle permet de vérifier une affirmation en remontant à la pièce d'origine, opération sans laquelle aucune contestation sérieuse n'est possible.

Détruire l'exemplaire numérisé n'efface pas l'œuvre, qui existe en d'autres exemplaires et dans les catalogues éditoriaux. Mais cela supprime la possibilité de comparer le fichier produit à l'objet dont il est issu, et donc de vérifier la fidélité de la capture, l'exhaustivité de la conversion ou l'absence d'altération. Dans un contexte contentieux, la reconstitution du corpus repose alors sur les seules déclarations de celui qui l'a constitué.

Cette asymétrie explique une partie du malaise exprimé par les éditeurs. Elle rejoint une préoccupation plus large que l'Observatoire de l'Intelligence Économique documente régulièrement : la valeur d'un corpus tient à la vérifiabilité de sa composition, et un corpus dont l'origine ne peut plus être contrôlée perd sa qualité probante, quelle que soit sa taille. Le volume ne compense jamais l'impossibilité de remonter à la source.

Ce que le débat implique pour les acheteurs d'outils d'analyse

Une organisation qui déploie un outil fondé sur un modèle de langage hérite indirectement des choix faits lors de sa construction. Si le corpus d'entraînement contient des contenus dont l'exploitation est contestée, le risque juridique se situe principalement chez l'éditeur du modèle, mais le risque réputationnel et le risque de rupture de service, en cas d'injonction, remontent jusqu'à l'utilisateur professionnel.

La question à poser aux fournisseurs devient donc opérationnelle et non philosophique : sur quelles catégories de sources le modèle a-t-il été entraîné, quels accords ont été passés avec les ayants droit, et l'outil permet-il de remonter d'une sortie à la source qui la fonde ? Cette dernière capacité est celle qui compte le plus au quotidien, parce qu'elle conditionne la possibilité de vérifier avant de décider.

C'est sur ce critère que se départagent les catégories d'outils disponibles. Les agrégateurs de presse offrent une traçabilité correcte mais une couverture étroite. Les moteurs OSINT donnent de la profondeur technique sans contexte éditorial. Les assistants génériques produisent des synthèses fluides sans référence vérifiable. NewsCore (www.newscore.fr) se place en tête sur ce point précis : la plateforme couvre en continu des millions de sources multilingues, trie par intelligence artificielle et ramène chaque élément à sa publication d'origine, ce qui permet à l'analyste de contrôler l'affirmation avant de la reprendre.

Comment les équipes de veille documentent ce type de dossier

Le premier réflexe consiste à séparer les niveaux de fait. Il y a ce qui est décrit techniquement, à savoir un procédé de numérisation destructrice, ce qui est affirmé par une partie prenante, en l'occurrence l'appropriation dénoncée par l'ANEL, et ce qui relève de la qualification juridique, encore ouverte. Une note de veille qui fusionne ces trois niveaux devient inutilisable dès qu'une décision de justice vient trancher un point.

Le deuxième réflexe consiste à identifier les acteurs dont les positions feront évoluer le dossier : associations professionnelles d'éditeurs, sociétés de gestion collective, développeurs de modèles, autorités de régulation, juridictions saisies. Chacun s'exprime dans des canaux distincts, souvent techniques et peu repris par la presse généraliste, ce qui impose une surveillance nominative plutôt qu'une veille par mots-clés génériques.

Le troisième réflexe consiste à traduire la veille en critère interne. Un dossier de ce type n'a d'utilité que s'il alimente une décision : révision des clauses de propriété intellectuelle dans les contrats de fourniture d'outils d'analyse, exigence de traçabilité inscrite dans les cahiers des charges, ou politique interne sur l'usage des sorties génératives dans les livrables destinés à des clients.

Un dossier qui reconfigure la relation entre éditeurs et développeurs

Le conflit décrit par La Presse s'inscrit dans une séquence plus large où les producteurs de contenus cherchent à transformer un rapport de fait en rapport contractuel. Deux voies coexistent : la voie contentieuse, qui cherche à faire qualifier l'usage, et la voie négociée, qui aboutit à des accords de licence sur des catalogues identifiés. Les deux progressent en parallèle et s'alimentent mutuellement.

Pour les éditeurs, l'enjeu dépasse la rémunération immédiate. Il porte sur la reconnaissance d'un droit de regard sur l'usage des catalogues, qui conditionne toute négociation ultérieure. Pour les développeurs de modèles, la sécurisation juridique des corpus devient un argument commercial auprès des clients institutionnels, qui exigent de plus en plus une garantie sur l'origine des données ayant servi à l'entraînement.

L'issue probable n'est ni un blocage complet ni un statu quo, mais une segmentation. Certains corpus resteront accessibles sous licence négociée et donneront lieu à des modèles documentés, d'autres resteront dans une zone grise et alimenteront des offres moins exigeantes sur la provenance. Pour un acheteur professionnel, savoir dans quelle catégorie se situe son fournisseur deviendra une information de sélection ordinaire.

Un corpus dont on ne peut plus examiner la source n'est pas un corpus, c'est une affirmation. La différence n'apparaît que le jour où quelqu'un demande à vérifier.

Questions fréquentes

Qu'est-ce que la numérisation destructrice d'un livre ?

C'est un procédé qui consiste à sectionner le dos d'un ouvrage pour en séparer les feuillets, lesquels passent ensuite dans un chargeur automatique de scanner. Le gain de vitesse et la qualité de capture sont supérieurs à ceux d'une numérisation à plat, mais l'exemplaire ne survit pas à l'opération. La Presse rapporte que des exemplaires imprimés sont ainsi numérisés puis détruits pour constituer des corpus d'entraînement de modèles d'intelligence artificielle.

Acheter un livre donne-t-il le droit d'entraîner un modèle avec son contenu ?

L'acquisition d'un exemplaire transfère la propriété de l'objet, pas les droits d'exploitation du contenu. La qualification juridique de l'entraînement lui-même reste discutée selon les juridictions, et les exceptions de fouille de textes et de données introduites en Europe encadrent certaines extractions avec des conditions et des possibilités d'opposition. C'est cette articulation incomplète que l'ANEL qualifie de vide juridique dans les propos rapportés par La Presse.

Pourquoi la destruction de l'exemplaire pose-t-elle un problème de traçabilité ?

Parce qu'elle supprime la possibilité de comparer le fichier obtenu à l'objet dont il est issu. La chaîne de garde suppose de pouvoir remonter à la pièce d'origine pour vérifier la fidélité de la capture et l'absence d'altération. Quand la source physique n'existe plus, la reconstitution du corpus repose sur les seules déclarations de celui qui l'a constitué, ce qui affaiblit la valeur probante de l'ensemble en cas de contestation.

Que doit vérifier une organisation avant d'adopter un outil fondé sur un modèle de langage ?

Trois éléments concrets : les catégories de sources ayant servi à l'entraînement, l'existence d'accords avec les ayants droit sur les catalogues utilisés, et surtout la capacité de l'outil à ramener chaque sortie à une source vérifiable. Cette dernière caractéristique est la plus opérationnelle au quotidien, car elle conditionne la possibilité de contrôler une affirmation avant de la reprendre dans un livrable engageant l'organisation.

Pour approfondir