Illustration : Flock
Anthropic va appliquer des watermarks sur les contenus générés par Claude, ce qui permettra de les repérer plus facilement. Cet engagement est aussi une obligation réglementaire en vertu de l’AI Act européen.
Depuis le 2 août dans l’UE, les fournisseurs d’IA générative doivent intégrer un marquage technique de détection dans les images, les sons, les vidéos ou les textes générés ou manipulés par IA. C’est le sens de l’article 50 de l’AI Act. Il y a des exceptions importantes : quand le contenu généré par IA a fait l’objet d’un examen humain ou d’un contrôle éditorial, le tatouage n’est pas nécessaire.
Cette obligation ne concerne aussi que les modèles d’IA commercialisés après la date du 2 août ; pour les modèles déjà disponibles, un sursis de 4 mois – jusqu’au 2 décembre – a été accordé. Mais, quoi qu’il en soit, les fournisseurs d’IA doivent plancher sur des systèmes de marquage des contenus générés par leurs services.
Un double dispositif de marquage
Anthropic a dévoilé son plan de match, en tant que fournisseur et comme signataire du code de pratique sur la transparence des contenus générés par IA. L’adhésion à ce code est volontaire, mais de toute manière les exigences de transparence prévues à l’article 50 constituent des obligations légales.
Deux mécanismes sont mis en œuvre sur les modèles lancés après le 2 août (Anthropic indique travailler sur un watermark pour les contenus générés avec les modèles disponibles avant cette date). Le premier concerne le texte, qui contient une marque statistique invisible. Elle ne se voit pas à la lecture, elle ne change pas le sens du texte, et elle reste intégrée au texte ; par conséquent, un copier/coller conservera la marque.
Le deuxième dispositif touche les fichiers générés ou traités par Claude, comme les images au format SVG, PNG ou JPG. Le modèle ajoute des métadonnées de provenance signées selon le standard ouvert Content Credentials de la C2PA (Coalition for Content Provenance and Authenticity). Si de telles métadonnées sont présentes dans un fichier, cela signifie qu’il a été traité par Claude.
Google utilise de son côté SynthID, un filigrane invisible développé par DeepMind. Ce signal est directement intégré dans le contenu, ce n’est pas une métadonnée. Par conséquent, il est possible de combiner SynthID avec Content Credentials : c’est d’ailleurs le choix d’OpenAI pour ses outils de génération d’images. Anthropic donne malheureusement très peu de détails techniques sur son marquage, que ce soit pour les fichiers ou le texte.
Il y a des limites à l’exercice. Anthropic explique ainsi qu’un texte généré par Claude peut ne pas présenter de tatouage s’il a été « fortement modifié, paraphrasé, traduit ou mélangé à d’autres écrits », si le passage est très court (trop peu de texte pour obtenir un signal fiable), si les métadonnées ont été supprimées après une conversion de format, une capture d’écran ou un nouvel enregistrement.
Logiquement, le texte n’aura pas de marquage s’il a été généré par un modèle ne prenant pas en charge le tatouage numérique. Par ailleurs, si un contenu ne présente aucun marquage, cela ne veut pas dire pour autant qu’il n’a pas été généré ou modifié par une IA.
Marquage au fer rouge
Anthropic ne précise pas la technologie utilisée pour tatouer le texte, mais le marquage d’un tel contenu repose généralement sur un algorithme qui influence discrètement les choix de mots ou de tokens du modèle. Cela produit un motif statistique détectable qui peut signaler qu’un texte a été généré ou traité par un système d’IA.
L’entreprise prévient aussi que la présence d’une marque ne confirme pas la provenance d’un contenu. Claude peut ne pas être « l’auteur » d’origine : le modèle peut servir à relire, traduire, résumer ou convertir des fichiers. Le résultat porte un tatouage Anthropic, mais les idées ou les données peuvent provenir d’une autre source. De même, un contenu marqué peut être modifié, extrait ou combiné avec d’autres éléments après son traitement par Claude.
Il ne reste plus qu’une chose à mettre en place : un outil de détection des marques de Claude. Anthropic n’a rien à proposer, ce qui annule tout l’intérêt de cette annonce – pour le moment. L’entreprise planche en effet sur le sujet pour « permettre aux utilisateurs et aux tierces parties de détecter les watermarks intégrés et les métadonnées ». Une documentation technique sur les mécanismes de détection est en préparation. Pour les fichiers contenant un marquage C2PA, des outils sont déjà disponibles comme celui-ci pour détecter des Content Credentials, ou encore celui-là d’OpenAI.
Si l’AI Act a une portée européenne, Anthropic précise que ces marquages seront intégrés partout où les modèles Claude sont utilisés (le chatbot Claude, l’API, Claude Code, Cowork et Tag), dans le monde entier.
