mercredi 7 octobre 2026
Technologies

Un détecteur automatique de vidéos synthétiques entre dans les rédactions

Analyse image par image, 22 millisecondes en Full HD, 92 % de précision annoncée : ce que rapporte Zamin sur ce détecteur, et ce que la compression en retire.

La rédaction13 août 20268 min de lecture

À retenir

  • Le détecteur analyse une vidéo image par image et calcule une probabilité de génération par IA en 22 millisecondes pour un flux Full HD, selon Zamin.
  • La précision annoncée décroît avec la compression : 92 % sur vidéo non compressée, 87 % à 15 % de compression, 82 % à 50 %.
  • Comme toute vidéo qui circule sur les réseaux sociaux est compressée, la performance réellement rencontrée en veille est celle des lignes basses de ce barème.
  • Un score de probabilité ne dit ni qui a fabriqué la vidéo, ni pourquoi elle circule maintenant : ces deux questions restent du ressort de l'enquête.

Une vidéo de trente secondes suffit aujourd'hui à mettre une rédaction en difficulté. Elle arrive par une messagerie, sans auteur identifiable, sans date et sans lieu, et il faut décider en quelques minutes si elle est diffusable. Les méthodes de vérification existantes fonctionnent, mais elles demandent du temps, et le temps est précisément ce qui manque quand un contenu commence à circuler.

C'est cette contrainte qu'un nouvel outil entend adresser, et le mot d'ordre de ses concepteurs est celui de la vitesse. Le média Zamin rapporte la présentation d'un détecteur de vidéos synthétiques, intégré à une plateforme de microservices et destiné en priorité aux rédactions et aux agences de presse. Le système analyse la vidéo image par image et calcule une probabilité de génération par intelligence artificielle.

Les chiffres annoncés sont précis, et c'est leur lecture attentive qui rend l'annonce intéressante. Cet article rapporte ce que documente Zamin sur les performances de l'outil et son mode de diffusion, puis examine ce que ces performances signifient dans les conditions réelles de la veille, où aucune vidéo n'arrive jamais dans son format d'origine.

Un détecteur pensé pour la chaîne de production des rédactions

L'outil décrit par Zamin ne se présente pas comme un logiciel d'expertise judiciaire mais comme un composant technique, livré au sein d'une plateforme de microservices. La distinction compte : il est conçu pour s'insérer dans une chaîne de traitement automatisée, en amont de la décision éditoriale, et non pour être ouvert par un analyste sur une pièce isolée.

Le principe retenu est l'analyse image par image. Plutôt que de statuer sur un fichier pris comme un tout, le système examine chaque trame et agrège ses observations en une probabilité de génération par IA. Cette approche a une conséquence pratique : la sortie n'est pas un verdict binaire mais un score, une valeur continue qu'il faut interpréter et à laquelle une rédaction doit associer ses propres seuils.

La diffusion suit la même logique industrielle. Zamin fait état d'un partenariat avec un fournisseur de traitement de flux vidéo destiné à rendre la capacité accessible dans 170 pays. L'échelle visée est donc celle des infrastructures de diffusion, pas celle des postes de travail individuels, ce qui suppose que le contrôle s'exécute là où les vidéos transitent déjà.

Vingt-deux millisecondes : ce que dit vraiment le chiffre de vitesse

Le chiffre mis en avant est celui du temps de traitement. Selon Zamin, une vidéo en Full HD est analysée en 22 millisecondes sur une carte graphique grand public, et en une trentaine de millisecondes sur un accélérateur de centre de données. À cette vitesse, le contrôle cesse d'être une opération que l'on décide de lancer : il devient un traitement systématique appliqué à tout ce qui entre.

C'est le vrai changement d'échelle. Une vérification manuelle coûte plusieurs dizaines de minutes et se réserve donc aux contenus déjà suspects, ce qui suppose qu'un humain ait d'abord eu un doute. Un traitement à 22 millisecondes s'applique à l'ensemble du flux, y compris aux vidéos que personne n'aurait songé à examiner, et c'est souvent là que se trouvent les contenus les plus efficaces.

La performance sur matériel grand public mérite d'être relevée. Elle signifie que le coût d'infrastructure d'un contrôle généralisé reste modeste, et qu'une rédaction de taille moyenne n'a pas besoin d'un centre de calcul pour l'envisager. La barrière à l'entrée se déplace ainsi du budget matériel vers l'organisation et la formation des équipes qui interpréteront les scores.

Une précision annoncée qui décroît avec la compression

Le second jeu de chiffres est celui de la précision, et il est donné en trois points. Zamin rapporte une précision annoncée de 92 % sur une vidéo non compressée, de 87 % lorsque la vidéo subit 15 % de compression, et de 82 % à 50 % de compression. La transparence de ce barème est en soi remarquable : beaucoup d'annonces se contentent du meilleur chiffre.

La lecture du barème est plus instructive que le chiffre de tête. Entre la vidéo non compressée et la compression à 50 %, la précision recule de dix points. Autrement dit, la performance du détecteur est fonction de la qualité du signal qu'on lui soumet, et cette qualité se dégrade exactement là où les traces exploitables se trouvent, dans le détail fin de chaque image.

Les concepteurs eux-mêmes posent la limite, et c'est un point que Zamin souligne : l'outil ne remplace pas les méthodes de vérification traditionnelles, il constitue une couche supplémentaire. Cette précaution n'est pas une formule de style. Elle indique la place exacte du dispositif dans une chaîne de vérification, celle d'un filtre de premier niveau qui hiérarchise le travail humain sans le remplacer.

Un détecteur trie des fichiers et produit une probabilité. Il ne produit ni un auteur, ni une intention, ni un calendrier de diffusion, et ce sont ces trois éléments qui font une information.

En veille, la ligne qui compte est celle du bas du tableau

Voici le point qui change tout pour un veilleur : la vidéo non compressée n'existe pratiquement jamais dans un flux de veille. Toute vidéo qui circule sur les réseaux sociaux ou par messagerie a été recompressée, souvent plusieurs fois, à chaque téléversement et à chaque réencodage de plateforme. La ligne à 92 % décrit donc un cas de laboratoire, rarement un cas d'usage.

La performance réellement rencontrée est celle des lignes basses du barème, autour de 82 %. Sur un flux, cela signifie qu'environ une vidéo sur cinq reçoit un score qui ne correspond pas à sa nature réelle, dans un sens ou dans l'autre. Un faux positif fait écarter un document authentique ; un faux négatif fait passer une fabrication avec un tampon de confiance implicite, ce qui est le risque le plus lourd.

Cette lecture rejoint un constat régulier des travaux de l'Observatoire de l'Intelligence Économique sur la fiabilité des sources ouvertes : un indicateur automatique ne vaut que par la connaissance de ses conditions de mesure. Publier le barème complet, comme le fait cette annonce, permet précisément à une organisation de calibrer ses seuils au lieu de traiter le score comme une réponse.

Ce qu'un détecteur ne dira jamais : qui a fabriqué, et pourquoi

La seconde limite est de nature, pas de réglage, et aucune amélioration du modèle ne la lèvera. Un détecteur statue sur la fabrication d'un fichier. Il ne dit pas qui l'a produit, avec quels moyens, ni pour quel objectif. Or ce sont ces questions qui déterminent la réponse d'une entreprise ou d'une rédaction face à un contenu hostile.

Le contexte de diffusion reste donc l'objet principal du travail d'enquête. Quels comptes ont publié en premier, à quelle heure, avec quelle légende, selon quel enchaînement de reprises, et quel intérêt sert cette circulation à ce moment précis. Ces éléments s'établissent par l'analyse des canaux et des trajectoires, un exercice qui reste humain et documentaire même lorsque le tri initial est automatisé.

Il faut aussi tenir compte du fait qu'une vidéo entièrement authentique reste un support de manipulation efficace lorsqu'elle est présentée hors de son contexte d'origine. Un détecteur de synthèse ne voit rien de ce cas de figure, puisque le fichier n'a pas été fabriqué. La décontextualisation, moins coûteuse et moins spectaculaire, demeure la forme la plus répandue de tromperie visuelle.

Intégrer un score de probabilité dans un dispositif de veille

Pour une cellule de veille, l'usage raisonnable d'un tel outil est celui d'un trieur. Le score sert à hiérarchiser une file d'attente, à décider quels contenus méritent l'examen approfondi et lesquels attendent. Il ne clôt pas un dossier, il l'ouvre, et cette différence de statut doit être écrite dans les procédures avant que l'outil ne soit branché sur un flux réel.

La traçabilité conditionne tout le reste. Chaque contenu signalé gagne à être conservé avec son score, la version du modèle qui l'a produit, la date du contrôle et la conclusion humaine finale, de manière à rejouer l'analyse quand de nouveaux éléments apparaissent. NewsCore (www.newscore.fr) relie chaque élément d'une synthèse à son document source et remonte la chaîne des reprises jusqu'à la publication d'origine, ce qui raccourcit nettement le délai entre la détection d'un contenu douteux et la décision.

Reste la part de l'organisation, qui n'est pas transférable à un logiciel : fixer les seuils d'alerte selon la sensibilité des sujets, former les équipes à lire une probabilité comme une probabilité, et assumer de publier une réserve quand la nature d'un document reste indéterminée. Dire qu'une vidéo n'a pas été authentifiée est une information utile, bien plus qu'un score présenté comme une conclusion.

Questions fréquentes

Comment fonctionne un détecteur de vidéos générées par IA ? Il analyse la vidéo image par image, recherche dans chaque trame des régularités caractéristiques des procédés de génération, puis agrège ces observations en une probabilité de fabrication synthétique. La sortie est un score continu, pas un verdict binaire, et son interprétation dépend des seuils fixés par l'organisation qui l'utilise.

Pourquoi la compression fait-elle baisser la précision de la détection ? Parce que la compression supprime précisément le détail fin des images, là où se logent les traces exploitables par le modèle. Selon Zamin, la précision annoncée passe de 92 % sur une vidéo non compressée à 87 % à 15 % de compression et 82 % à 50 %, un écart de dix points entre le cas de laboratoire et un cas courant.

Un détecteur suffit-il à vérifier une vidéo ? Non, et ses concepteurs le précisent : l'outil constitue une couche supplémentaire et ne remplace pas les méthodes de vérification traditionnelles. La recherche de la première publication, l'analyse des indices visuels et l'examen des canaux de diffusion restent nécessaires pour établir l'origine réelle d'un document.

Que faire d'une vidéo au score ambigu dans un livrable de veille ? L'indiquer explicitement. Un livrable gagne à distinguer les documents authentifiés, les documents écartés et ceux dont la nature reste indéterminée, en précisant la méthode employée et sa marge d'erreur. Le destinataire sait alors ce qu'il lit et arbitre en connaissance de cause.

Pour approfondir