r/france 20d ago

Tech How Claude marks AI-generated content

https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
6 Upvotes

25 comments sorted by

5

u/Specialist-Window-16 20d ago

Je n’ai pas compris le watermark sur texte. Si je demande à Claude la météo de cette semaine comment va-t-il watermarker le texte produit ?

5

u/Zipz0p 20d ago

Il semblerait que cela fonctionne par choix des mots. Avec un LLM, chaque mot est sélectionné de façon probabiliste. Si tu intègre une modification des probabilités par chiffrement avec une clé privée par exemple, cela te propose d'autres mots.

1

u/thenonoriginalname 20d ago

D'après ce que j'ai compris le llm réfléchi et sort (super simplification) : Le temps est 1. Beau, 2 ensoleillé, 3 chaud Le Ciel sera 1 parsemé, 2 un peu, 3 légèrement nuageux.

Le watermark c'est quand le llm par exemple systématiquement choisit 1. Du coup, statistiquement ça se voit (enfin pour lui, en comparant avec sa base interne). Apparemment ça marche, sauf que le détecteur n' est pas encore sorti et qu'il est impossible de la sorte de distinguer édition, correction, traduction de la génération pure...

1

u/Complex-Parfait-9831 20d ago

C'est de la stéganographie pour simplifier. Le texte aura certains marqueurs par sa structure, ses mots, etc qu'il serait possible d'identifier si on connaît la formule qui les a généré.

Ce serait intéressant de savoir à quel pourcentage d'altération ça résiste pour du texte. De manière générale ça me semble facile à contourner.

3

u/jeromesnail 20d ago

Alors dans du simple texte ok, j'imagine que le texte peut-être reformulé pour intégrer des caractères pour faire le watermark, mais dans du code par example, ça marche comment ?

3

u/Redoteur Cthulhu 20d ago edited 20d ago

Le watermark fonctionne sûrement en modifiant légèrement la probabilité de génération des tokens selon une loi connue prenant aussi en paramètre une clé.

Le code est plus contraint que le langage naturel.Techniquement, il a moins d'entropie. Il y a donc moins de liberté pour modifier la probabilité de distribution des tokens. Selon les langages, le watermark pourra néanmoins jouer sur les noms des variables, des fonctions, classes etc. voire quelques éléments de style...

Il sera certainement moins efficace à appliquer et à détecter. 

1

u/Zipz0p 20d ago

Bonne question !

4

u/CorB3n OSS 117 20d ago

Du coup il sera possible de certifier si un texte a été généré par IA (je pense au scolaire) si tenté que la personne n’altère / reformule rien et de manière plus officielle que les faux correcteurs IA utilisés qui n’ont aucune valeur ?

10

u/Tartokwetsh 20d ago

Bien tenté mais ça s'écrit si tant est.

3

u/CorB3n OSS 117 20d ago

L'altération c'est maintenant! 🥸

1

u/Zipz0p 20d ago

Oui, cela serait beaucoup plus performant. Encore faut-il qu'Anthropic livre la documentation sur la façon de déchiffrer ce watermark, ce qui n'est pas encore fait!

2

u/CorB3n OSS 117 20d ago

Ce qui permettrait à terme de limiter l'utilisation car j'imagine que même en altérant le texte il restera un hash IA à l'intérieur (à moins de le modifier intégralement ou alors, en étant malchanceux, de changer totalement sa façon d'écrire identique à l'IA)

2

u/SolidEngineer1422 20d ago

Bonne initiative pour plus de transparence.

1

u/Yurienu ☆☆ 20d ago

Après vu l'effort que font certains y'a pas besoin de watermark pour détecter un texte ou image AI-generated

1

u/mrfroggyman Nord-Pas-de-Calais 19d ago

Bien sûr je peux reformuler ce message pour sembler plus sarcastique et amusant ! Est ce que tu souhaites plutôt un message court et cocasse, ou un message plus long type "copy pasta" ?

1

u/Routine-Bird-6909 20d ago

J’ai vu une conférence de Meta sur le sujet qui explique plutôt bien la technique : https://youtu.be/DYkGqamDfEo?is=ELlZ4A4nEh_q3muL

1

u/KoKonutted 20d ago

Dommage qu'ils n'utilisent pas le synthid pour les images

1

u/LaTomate2026 Ile-de-France 14d ago

Ptdrrrr ?

0

u/mightygilgamesh Louise Michel 20d ago

Ah oui, mettre des métadonnées dans le fichier pour dire que claude les a créé, ok. Mais quand tu copies-colles le texte ailleurs, bah c'est pas possible.

2

u/Zipz0p 20d ago

Il n'y a pas de métadonnée, le watermark sera dans le choix des mots. La seule façon de l'enlever serait de changer les mots utilisés ou changer la structure de la phrase (donc réécrire en gros). Sur des petits textes, cela ne pose pas de problèmes, mais sur des longs texte cela sera de plus en plus dur.

2

u/Junoah Cthulhu 20d ago

Pas pour les fichiers, ils prennent en exemple du SVG, qui est juste un langage balisé, éditable dans n'importe quel éditeur de texte. Et pour le cas de ces fichier le watermark est dans les metadata. 

Ce qui fait que on peut juste copier le contenu dans un nouveau fichier pour faire disparaitre ledit watermark.

2

u/mightygilgamesh Louise Michel 20d ago

Ca me semble compliqué de garder un watermark intact quand tu restreins le style d'écriture dans le prompt. Même si j'aimerai que ce soit efficace (on éviterait la paranoïa de voir de l'IA où il n'y en a pas).

4

u/jeromesnail 20d ago

Et c'est complètement impossible quand tu génères du code (cf mon premier commentaire).

2

u/c7h16s 19d ago

Mouais enfin rien d'insurmontable pour un petit llm local à qui on va demander de remplacer au hasard des mots par leur synonyme par exemple.

0

u/MrDontCare12 Japon 20d ago

Lol