Si votre organisation publie des textes, des images ou tout autre contenu en ligne, vous avez probablement deja un avis sur la question de savoir si les entreprises d'IA devraient pouvoir les exploiter pour entrainer leurs modeles. Depuis 2019, le droit de l'UE donne aux titulaires de droits un moyen formel de s'y opposer : l'opt-out pour la fouille de textes et de donnees prevu a l'article 4 de la directive DSM. La plupart des editeurs qui l'ont mis en place considerent la tache terminee des qu'une ligne robots.txt ou une balise TDMRep est active sur le site. C'est la partie facile. La partie difficile, celle qui determine vraiment si l'opt-out tient dans un litige, consiste a prouver quand il etait actif et ce qu'il disait exactement.
Ce que l'article 4 vous accorde reellement
L'article 4 de la directive DSM cree une exception permettant la reproduction et l'extraction d'oeuvres licitement accessibles a des fins de fouille de textes et de donnees, sans necessiter de licence dans un grand nombre de cas. L'article 4, paragraphe 3, trace ensuite la limite qui compte pour les titulaires de droits : l'exception ne s'applique que si le titulaire n'a pas expressement reserve ses droits. Pour les contenus rendus publiquement accessibles en ligne, cette reserve doit etre exprimee "de maniere appropriee, telle que des moyens lisibles par machine". En clair, une mention ecrite quelque part sur une page ne suffit pas. La reserve doit etre lisible par les robots et les chaines de traitement qui effectuent effectivement la fouille, ce qui explique pourquoi la plupart des mises en oeuvre reposent sur une directive robots.txt, une balise meta HTML, ou le TDM Reservation Protocol (TDMRep) concu specifiquement a cet effet.
Poser ce signal est une tache technique ponctuelle. En conserver la preuve ne l'est pas, et c'est precisement la que la plupart des titulaires de droits s'arretent.
Pourquoi l'opt-out a desormais du poids, et pourquoi cela releve les enjeux
Pendant quelques annees, l'article 4, paragraphe 3, est reste une protection largement theorique. Cela a change avec l'AI Act de l'UE. Les fournisseurs de modeles d'IA a usage general mis sur le marche de l'UE sont desormais soumis a une obligation directe, prevue a l'article 53 de l'AI Act, de mettre en place une politique de conformite au droit d'auteur de l'UE, et notamment d'identifier et de respecter les reserves de droits exprimees en vertu de l'article 4, paragraphe 3, de la directive DSM. Cette obligation s'applique quel que soit le lieu ou le fournisseur du modele est etabli ou ou l'entrainement a effectivement eu lieu, des lors que le modele est mis sur le marche de l'UE.
Cela transforme l'opt-out d'une position juridique passive en quelque chose que les deux parties doivent desormais gerer activement. Un fournisseur de modele doit demontrer qu'il a verifie et respecte la reserve. Vous, en tant que titulaire de droits, pourriez devoir prouver que la reserve etait en place, sous la bonne forme, avant que le contenu ne soit collecte pour l'entrainement. Ces deux questions portent sur un moment precis, pas sur l'etat actuel de votre site. Un fichier robots.txt ne montre jamais que ce qui s'y trouve aujourd'hui. Il ne dit rien de ce qu'il contenait il y a six mois, au moment ou une fouille particuliere a peut-etre eu lieu.
Ou l'ecart de preuve se fait vraiment sentir
Trois situations reviennent regulierement des que l'on regarde au-dela de la mise en place initiale :
- Une refonte du site ou une migration de CMS ecrase le fichier robots.txt, et l'ancienne directive d'opt-out disparait sans aucune trace locale du moment ou elle a ete retiree ni de ce qu'elle disait a l'origine.
- Un litige porte sur le calendrier. Un fournisseur de modele affirme que l'entrainement precede votre reserve ; vous pensez le contraire. Sans un instantane date de votre signal d'opt-out, la question devient celle de qui est le plus convaincant plutot que ce qui est prouvable.
- L'opt-out evolue dans le temps, passant par exemple d'un blocage general via robots.txt a une politique TDMRep plus fine qui reserve les droits pour l'entrainement de l'IA tout en autorisant l'indexation par les moteurs de recherche. Si une fouille a eu lieu entre deux versions, seul un historique date des versions permet de savoir quelle politique s'appliquait reellement a ce moment-la.
Aucun de ces cas n'est hypothetique. Ce sont les consequences ordinaires de l'exploitation d'un site web actif pendant plus de quelques mois. Un opt-out lisible par machine resout le probleme "une machine peut-elle le lire". Il ne fait rien pour le probleme "pouvez-vous prouver que c'etait vrai a une date precise", et c'est cette seconde question qui tranche reellement un litige.
Ce qu'un enregistrement date doit apporter
Un enregistrement d'opt-out defendable a besoin de trois elements qu'un fichier robots.txt en ligne ne peut fournir a lui seul : un instantane du fichier ou de la balise exacte tels que publies, un horodatage provenant d'une source que vous ne controlez pas vous-meme, et un moyen pour un tiers, y compris hors de l'UE, de verifier les deux sans devoir vous croire sur parole. Sceller un hash date de votre robots.txt, de votre declaration TDMRep ou de votre balise meta HTML a chaque publication ou mise a jour construit cet enregistrement de maniere incrementale, au moment ou chaque version est mise en ligne plutot qu'apres coup, quand il est trop tard pour le reconstituer.
C'est aussi la que la valeur de la preuve sous-jacente compte au-dela de l'UE. Un litige sur des donnees d'entrainement ou une negociation de licence avec un fournisseur de modele ne se deroulera pas toujours devant une autorite de l'UE. Il peut atterrir devant le service juridique d'un laboratoire d'IA americain, un tribunal arbitral international, ou une juridiction qui n'a jamais entendu parler de la directive DSM. Une preuve dont la seule force repose sur "faites confiance a nos journaux serveur" ne voyage pas bien dans cette conversation. Un enregistrement qualifie et horodate de maniere independante, si, parce que sa valeur probante ne depend pas de la juridiction qui pose la question. C'est la meme logique qui s'applique a tout document que vous pourriez devoir defendre en dehors du pays ou vous l'avez cree : une preuve qui tient globalement vaut plus qu'une preuve qui ne fonctionne que chez elle.
Ce qu'il faut conserver dans l'enregistrement
Un instantane scelle utile n'a pas besoin d'etre complique. Conservez au minimum le texte integral de la directive robots.txt ou de la declaration TDMRep telle que publiee, l'URL ou le sous-domaine auquel elle s'appliquait, et la date de sa mise en ligne. Les organisations plus importantes qui gerent plusieurs sites, sous-domaines regionaux ou versions linguistiques d'un meme site devraient sceller chacun separement, car une reserve posee sur un domaine ne s'etend pas automatiquement a un autre, et un robot qui a ignore la politique d'un sous-domaine ne sera pas excuse par une reserve qui n'existait que sur le site principal. Si votre equipe juridique ou de conformite doit produire des preuves lors d'un audit ou d'une negociation de licence, disposer d'un fichier date par site vaut mieux que reconstituer un historique a partir de pages en cache et de suppositions.
Il vaut egalement la peine de conserver l'enregistrement meme apres avoir modifie ou retire un opt-out. Si vous decidez plus tard de licencier votre contenu pour l'entrainement de l'IA plutot que de le bloquer, un historique date montrant precisement quand la reserve a ete levee vous protege du probleme inverse : une accusation selon laquelle vous etiez encore opt-out apres avoir en realite deja accorde la permission.
En faire une habitude editoriale normale
La solution pratique est plus modeste qu'il n'y parait. Traitez votre signal d'opt-out TDM comme vous traiteriez un contrat ou un fichier de conception date : scellez-le au moment ou il change, conservez l'enregistrement scelle separement du site actif, et repetez le processus a chaque mise a jour de la politique, pas seulement une fois au lancement. Pour les organisations qui publient des jeux de donnees, de la documentation de modele ou des conditions de licence aux cotes de leur contenu, la meme discipline s'applique a ce materiel. Notre page sur la documentation de la provenance des donnees d'entrainement IA explique comment construire un enregistrement date et verifiable sur l'ensemble du cycle de vie d'un jeu de donnees, pas seulement pour le signal d'opt-out a sa marge.
L'article 4, paragraphe 3, vous donne le droit de reserver votre contenu. Il ne vous donne pas la preuve que vous avez exerce ce droit a un moment precis. Construisez vous-meme l'enregistrement date, avant d'en avoir besoin, et l'opt-out signifiera reellement ce qu'il affirme.
Commencez a sceller vos signaux d'opt-out TDM et vos enregistrements de jeux de donnees avec un horodatage date et verifiable de maniere independante, afin que la preuve soit prete avant qu'un litige ne vous force a la reconstituer.





