Supprimer le watermark textuel de Claude

Comment supprimer le watermark textuel de Claude ?

Anthropic commence à intégrer un watermark invisible dans les textes générés par Claude. Pas de caractère caché à supprimer ni de métadonnée attachée au fichier : le marquage repose sur les mots et tokens choisis pendant la génération. Et quelques jours après que le sujet a commencé à faire parler de lui, un repo public consacré au reverse engineering de SynthID Text propose déjà plusieurs méthodes pour dégrader ce signal. Pour comprendre comment on peut supprimer un watermark textuel, il faut d'abord comprendre ce qui est réellement marqué.

Claude cache-t-il vraiment quelque chose dans ses textes ?

Le mot « watermark » peut faire penser à un caractère Unicode invisible ou à une information cachée dans le fichier. Ce n'est pas le principe utilisé ici.

D'après les informations publiées sur le dispositif d'Anthropic, Claude s'appuie sur une approche dérivée de SynthID Text, la technologie de watermarking développée par Google DeepMind.

Un LLM ne choisit pas directement une phrase entière. Il sélectionne progressivement des tokens parmi plusieurs candidats possibles. Imaginons que Claude puisse poursuivre une phrase avec « gris », « couvert » ou « nuageux ». Plusieurs réponses sont acceptables.

SynthID intervient dans cette distribution de probabilités et favorise légèrement certains tokens plutôt que d'autres. Pour un lecteur, le résultat reste un texte normal. Mais lorsqu'on observe assez de tokens, la succession de ces choix forme un motif statistique détectable.

Le watermark se trouve donc dans la séquence elle-même. Copier le texte dans un autre logiciel ne suffit pas à le supprimer.

Pourquoi ce watermark peut-il être supprimé ?

Cette méthode a une faiblesse assez intuitive : elle dépend de la séquence exacte de tokens produite par le modèle.

Si on modifie suffisamment cette séquence, le motif statistique attendu devient plus difficile à retrouver. C'est très différent du watermark d'une photo, qui peut être réparti dans les pixels et conçu pour résister à une compression ou à un léger recadrage.

Google lui-même explique que SynthID Text fonctionne mieux sur les textes relativement longs et variés. DeepMind précise aussi que le watermark n'est pas une solution absolue contre un adversaire déterminé.

Une petite correction ne garantit donc pas sa disparition. À l'inverse, une réécriture importante peut modifier une grande partie des tokens qui constituaient le signal initial.

Un repo public propose déjà de supprimer SynthID Text

Le repo GitHub aloshdenny/reverse-SynthID-text est apparu comme un exemple concret de cette course entre watermarking et contournement.

Le projet reprend l'implémentation publique de SynthID Text et propose plusieurs familles d'attaques contre le watermark :

  • paraphraser complètement le texte avec un autre modèle
  • remplacer une partie des tokens par des synonymes
  • insérer ou retirer des mots afin de modifier les n-grams utilisés par le détecteur

Le repo expérimente également des homoglyphes Unicode, des caractères qui ressemblent visuellement à d'autres caractères mais possèdent une représentation informatique différente.

L'auteur annonce des taux de réussite élevés pour certaines méthodes, notamment la paraphrase. Ces chiffres proviennent du repo lui-même et ne constituent pas une validation indépendante de leur efficacité contre l'implémentation exacte utilisée par Claude.

La paraphrase est-elle suffisante pour retirer le watermark ?

C'est la piste la plus évidente techniquement. Une paraphrase conserve le sens général du texte tout en reconstruisant une nouvelle succession de tokens.

Le watermark statistique initial dépendant de cette succession, une réécriture assez profonde peut fortement dégrader son signal. C'est aussi ce qui rend les watermarks textuels difficiles à rendre indestructibles : un texte peut être reformulé sans que son contenu disparaisse.

En revanche, demander à Claude lui-même de reformuler un texte n'est pas nécessairement une bonne stratégie si la nouvelle réponse reçoit à son tour un watermark. Utiliser un autre modèle non watermarked, réécrire manuellement ou combiner plusieurs transformations change davantage le problème.

Cette limite ne signifie pas que le système est inutile. Son intérêt est surtout de détecter les sorties relativement proches de ce que le modèle a effectivement généré, pas de garantir qu'un texte restera identifiable après une réécriture complète.

Un simple copier-coller ou quelques corrections suffisent-ils ?

Non. Puisque le watermark est intégré aux choix de tokens, le copier-coller conserve la séquence.

Modifier une faute, une ponctuation ou quelques mots ne détruit pas nécessairement assez d'information pour faire disparaître le motif statistique. Le principe du détecteur consiste justement à agréger un grand nombre de petits signaux : perdre quelques-uns de ces signaux n'empêche pas forcément la détection.

Plus le texte est profondément transformé, plus la signature d'origine a de chances d'être affaiblie. Mais il n'existe pas de seuil universel du type « remplacer 20 % des mots suffit ». Le résultat dépend de la longueur du texte, des paramètres du watermark et de la méthode de détection.

Le watermark de Claude est-il exactement celui du repo GitHub ?

C'est le point sur lequel il faut rester prudent. SynthID Text est open source, ce qui permet d'étudier son fonctionnement et de construire des attaques expérimentales. Anthropic utilise une approche basée sur cette technologie pour ses nouveaux mécanismes de transparence.

Cela ne permet pas d'affirmer que tous les paramètres internes de Claude, ses clés, son détecteur ou ses futurs ajustements sont identiques à l'implémentation de référence publiée par Google.

Le repo reverse-SynthID-text démontre donc surtout une chose intéressante : les principes techniques du watermark peuvent être attaqués publiquement dès lors que leur fonctionnement est connu. Il ne prouve pas qu'un bouton permet aujourd'hui d'effacer systématiquement et avec certitude n'importe quel watermark produit par Claude.

Un watermark est différent d'un détecteur de texte IA

La distinction est importante. Les détecteurs classiques tentent de déterminer si un texte ressemble statistiquement à une production d'IA. Ils peuvent donc se tromper sur un texte humain ou ne pas reconnaître un texte généré puis retravaillé.

Avec un watermark, le modèle modifie volontairement sa génération afin de laisser un signal précis que le détecteur pourra rechercher ensuite.

Cela rend une détection positive beaucoup plus intéressante qu'un score générique de type « 87 % de chances que ce texte soit généré par une IA ». Mais l'inverse reste faux : ne pas détecter de watermark ne prouve pas qu'un humain a écrit le texte. Il peut provenir d'un autre modèle, avoir été réécrit ou avoir été généré avant l'activation du dispositif.

Le début d'une course entre watermarking et suppression

Le plus intéressant dans cette histoire n'est finalement pas qu'un watermark puisse être retiré. C'était une limite connue des techniques de marquage statistique du texte.

Ce qui change, c'est leur arrivée dans des assistants utilisés quotidiennement. Anthropic doit rendre les contenus générés plus facilement identifiables, tandis que des développeurs testent presque immédiatement les limites du système.

La situation ressemble donc moins à l'apparition d'une signature impossible à effacer qu'à une nouvelle course entre génération, détection et transformation du texte. Les watermarks pourront devenir plus robustes. Les outils de paraphrase progresseront eux aussi.

Pour l'utilisateur, une conséquence est déjà claire : le watermark peut indiquer qu'un texte a été généré ou traité par un système compatible, mais il ne permettra jamais à lui seul de reconstruire précisément qui en est l'auteur ni comment il a été utilisé.

Sources

  • The Verge : explications sur l'utilisation de SynthID Text par Anthropic pour le watermarking des textes de Claude.
  • Google DeepMind : présentation du fonctionnement de SynthID pour le texte et de ses limites.
  • Google AI for Developers : documentation technique et implémentation open source de SynthID Text.
  • Google DeepMind sur GitHub : implémentation de référence de SynthID Text et de ses détecteurs.
  • aloshdenny/reverse-SynthID-text : repo public consacré au reverse engineering et aux méthodes expérimentales de suppression du watermark.

Comment supprimer le watermark textuel de Claude ?

Le watermark repose sur la succession statistique des tokens générés. Une réécriture profonde ou une paraphrase peut donc dégrader cette signature en produisant une nouvelle séquence de tokens. Un simple copier-coller ne suffit pas.

Le watermark de Claude utilise-t-il des caractères invisibles ?

Non. Le mécanisme présenté repose sur SynthID Text, qui influence légèrement les probabilités de sélection des tokens pendant la génération afin de créer un motif statistique invisible à la lecture.

Copier un texte Claude dans Word supprime-t-il son watermark ?

Non. Le watermark est porté par la séquence de texte elle-même et non par les métadonnées du fichier. Le copier-coller conserve donc normalement le signal.

Un texte sans watermark est-il forcément écrit par un humain ?

Non. Il peut provenir d'un modèle qui n'utilise pas ce watermark, avoir été fortement réécrit ou avoir été généré avant son activation. L'absence de watermark ne constitue pas une preuve d'origine humaine.

SynthID Text est-il open source ?

Oui. Google DeepMind a publié une implémentation de référence de SynthID Text ainsi qu'une documentation permettant aux développeurs d'intégrer et d'étudier cette méthode de watermarking.

Sur le même sujet

Google DeepMind
SynthID de Google DeepMind

Qu'est ce que le SynthID de Google DeepMind ?

Dans un monde où les contenus générés par IA se multiplient à une vitesse fulgurante, une question cruciale émerge : comment distinguer le vrai du faux ? Google DeepMind a développé une réponse intéressante avec SynthID, une technologie de filigranage numérique qui s'attaque à ce problème.

OpenAI filigranage
OpenAI et le système de filigranage non déployé

OpenAI dispose d'un système de filigranage capable de détecter le contenu de ChatGPT, mais refuse de le rendre public

Pendant que les profs et les entreprises luttent contre l'explosion du contenu généré par IA, OpenAI détient une solution depuis près d'un an : un système de filigranage et un outil de détection avec une précision de 99,9% pour identifier les textes créés par ChatGPT. Pourtant, l'entreprise refuse de le rendre public !

remboursement panne
Remboursement abonnement IA pendant une panne

Peut-on se faire rembourser son abonnement en cas de panne de Claude ou ChatGPT ?

Le 2 juin, Claude a subi une panne majeure. Des erreurs élevées sur plusieurs modèles ont rendu l'outil inutilisable pendant des heures. Quand on paie 20 € ou même 100 € par mois pour un abonnement, cette indisponibilité pose une question directe : peut-on exiger un remboursement ? L'incident du 2 juin n'est pas un cas isolé. Les pannes touchent tous les fournisseurs d'IA. Voici ce que prévoient réellement les conditions d'Anthropic et d'OpenAI en cas d'interruption de service.

Doctolib données de santé
Doctolib, données de santé et IA américaines

Les données de Doctolib sont-elles utilisées pour entraîner des IA américaines ?

La question revient depuis les révélations du Canard enchaîné : les données de Doctolib servent-elles à entraîner des IA américaines ? La réponse courte est nuancée. On a des preuves que Doctolib utilise des prestataires comme Microsoft Azure, Google Gemini ou Anthropic pour certains services. On n'a pas, à ce stade, de preuve publique solide que ces entreprises entraînent leurs propres modèles avec les données médicales des patients.

Cet article fait le tri entre ce qui est documenté, ce qui est contesté, et ce qui reste problématique pour les utilisateurs comme pour les professionnels de santé.

Anthropic OpenAI
Claude vs ChatGPT : le choc des IA

Claude dépasse ChatGPT sur l'App Store : l'effet Pentagone

En février 2026, l'IA Claude d'Anthropic a détrôné ChatGPT d'OpenAI en tête des téléchargements sur l'App Store américain. Ce revirement spectaculaire n'est pas lié à une mise à jour technique, mais à une controverse éthique majeure avec le Pentagone. Cet article décrypte pourquoi une interdiction gouvernementale a paradoxalement propulsé Claude au sommet, et ce que cela révèle de l'importance croissante de l'éthique dans l'IA pour le grand public.

Politique Anthropic
Anthropic face au gouvernement américain

Anthropic : le dernier rempart moral de l'IA aux États-Unis ?

Parler de « dernier gardien de la morale » est fort. C'est presque une formule de série télé. Mais quand on regarde ce qui se passe outre-Atlantique entre Anthropic et l'administration Trump, on se pose la question. Pendant que OpenAI signe des accords avec le Pentagone, la firme de Dario Amodei claque la porte. S'agit-il d'un coup de com', d'une naïveté dangereuse ou d'une vraie ligne rouge éthique ? Il faut regarder au-delà du buzz politique pour comprendre les enjeux réels.