OpenAI va progressivement intégrer un filigrane invisible aux textes générés par ChatGPT et Codex dans l’Union européenne. Une mesure destinée à répondre aux nouvelles obligations de transparence de l’AI Act, mais dont l’efficacité pourrait rapidement diminuer dès qu’un texte est retravaillé.
Un filigrane invisible dans les réponses de ChatGPT
OpenAI s’adapte aux nouvelles règles européennes. L’entreprise va déployer dans les prochaines semaines un système permettant d’identifier les textes produits par ChatGPT et Codex dans l’Union européenne.
Baptisée textGrain, cette technologie ne repose pas sur l’ajout de caractères invisibles ou de métadonnées qui pourraient disparaître lors d’un simple copier-coller. Le filigrane est directement intégré à la structure du texte.
Concrètement, le modèle modifie légèrement la manière dont il sélectionne certains mots (plus précisément certains tokens) lorsqu’il génère une réponse. L’accumulation de ces choix va alors créer un motif statistique invisible pour le lecteur, mais qui peut ensuite être reconnu par un outil disposant de la clé nécessaire. Le texte restera donc parfaitement normal à l’écran, et copier une réponse de ChatGPT dans Pages, Word ou un mail ne supprimera pas automatiquement son filigrane.
Une conséquence de l’AI Act européen
Ce changement doit permettre à OpenAI de se conformer aux nouvelles obligations de l’AI Act, qui impose notamment aux fournisseurs d’IA générative de rendre les contenus produits par leurs modèles identifiables par une machine.
Le dispositif sera progressivement activé pour les utilisateurs européens de ChatGPT et Codex, quelle que soit leur formule. OpenAI ne prévoit en revanche pas, pour le moment, de généraliser automatiquement ce marquage au reste du monde.
Les développeurs utilisant l’API pourront également choisir de l’activer sur certains modèles. OpenAI assure que ses essais n’ont montré aucune dégradation significative de la qualité ou de la vitesse de génération avec textGrain.
Un système loin d’être infaillible
Mais il y a bien des moyens pour contrer cela. Il suffit en effet d'apporter suffisamment de modifications au texte générer pour rendre le filigrane beaucoup plus difficile à détecter. Lors d’un test, OpenAI serait ainsi parvenue à reconnaître environ 92 % des textes originaux. Mais après le remplacement de seulement 10 % des mots par des synonymes, le taux de détection tombait à environ 66 %.
Le problème est évident pour les usages réels de ChatGPT. Un texte généré par une IA est souvent corrigé, raccourci, réorganisé ou reformulé avant d’être publié et ainsi passer les filtres statistiques.
Les textes très courts, les traductions ou encore certains contenus fortement contraints sont également plus difficiles à identifier. OpenAI insiste donc sur un point important : l’absence de filigrane ne permettra pas de conclure qu’un texte a été écrit par un humain. Il peut simplement avoir été suffisamment modifié pour que le signal ne soit plus détectable.
Pas question d’identifier l’utilisateur
Ce filigrane ne devrait pas non plus permettre de retrouver la personne ayant utilisé ChatGPT. Selon OpenAI, textGrain permet uniquement de détecter un signal associé à ses modèles. Il ne contient aucune information permettant de retrouver le compte, les prompts ou les conversations ayant servi à produire le contenu.
Enfin, le détecteur ne sera pas accessible à tout le monde dans un premier temps. OpenAI prévoit de le réserver à des chercheurs et organismes spécialisés préalablement approuvés, notamment pour évaluer son efficacité et limiter les risques de mauvaises interprétations.
QU’EN PENSER ?
OpenAI n’est évidemment pas la seule entreprise concernée par les nouvelles obligations européennes. Les autres grands acteurs de l’IA générative vont également devoir mettre en place des mécanismes permettant d’identifier leurs contenus.
L’Europe pourrait ainsi devenir un terrain d’expérimentation grandeur nature pour ces technologies de traçabilité. Leur efficacité réelle restera toutefois à démontrer, notamment face aux outils capables de reformuler automatiquement un texte.