Se la vostra organizzazione pubblica testi, immagini o altri contenuti online, probabilmente avete gia un'opinione su se le aziende di intelligenza artificiale debbano poterli usare per addestrare i loro modelli. Dal 2019 il diritto dell'UE offre ai titolari dei diritti un modo formale per rifiutare: l'opt-out per il text and data mining previsto dall'articolo 4 della direttiva DSM. La maggior parte degli editori che lo ha attivato considera il compito concluso non appena una riga nel robots.txt o un tag TDMRep e attivo sul sito. Questa e la parte facile. La parte difficile, quella che decide davvero se l'opt-out regge in una controversia, e dimostrare quando era attivo e cosa diceva esattamente.
Cosa garantisce davvero l'articolo 4
L'articolo 4 della direttiva DSM introduce un'eccezione che consente la riproduzione e l'estrazione di opere lecitamente accessibili a fini di text and data mining, senza bisogno di una licenza in un'ampia gamma di casi. L'articolo 4, paragrafo 3, traccia poi il confine che conta per i titolari dei diritti: l'eccezione si applica solo se il titolare non ha espressamente riservato i propri diritti. Per i contenuti resi pubblicamente accessibili online, tale riserva deve essere espressa "in modo appropriato, ad esempio con mezzi leggibili da dispositivo automatico". In pratica, un avviso scritto da qualche parte sulla pagina non basta. La riserva deve essere leggibile dai crawler e dalle pipeline che effettivamente eseguono il mining, motivo per cui la maggior parte delle implementazioni si affida a una direttiva robots.txt, un tag meta HTML, o al TDM Reservation Protocol (TDMRep) sviluppato proprio per questo scopo.
Impostare questo segnale e un compito tecnico da fare una sola volta. Conservarne la prova non lo e, ed e proprio qui che la maggior parte dei titolari di diritti si ferma.
Perche l'opt-out ora ha peso, e perche questo alza la posta
Per qualche anno l'articolo 4, paragrafo 3, e rimasto per lo piu una tutela teorica. Questo e cambiato con l'AI Act dell'UE. I fornitori di modelli di IA per finalita generali immessi sul mercato dell'UE sono ora soggetti a un obbligo diretto, previsto dall'articolo 53 dell'AI Act, di adottare una politica per la conformita al diritto d'autore dell'UE, e in particolare di individuare e rispettare le riserve di diritti espresse ai sensi dell'articolo 4, paragrafo 3, della direttiva DSM. Questo obbligo si applica indipendentemente da dove sia stabilito il fornitore del modello o da dove sia effettivamente avvenuto l'addestramento, purche il modello sia immesso sul mercato dell'UE.
Questo trasforma l'opt-out da una posizione giuridica passiva in qualcosa che entrambe le parti devono ora gestire attivamente. Un fornitore di modelli deve dimostrare di aver verificato e rispettato la riserva. Voi, come titolari dei diritti, potreste dover dimostrare che la riserva era in vigore, nella forma corretta, prima che il contenuto fosse raccolto per l'addestramento. Entrambe sono domande su un momento preciso, non sullo stato attuale del vostro sito. Un file robots.txt mostra sempre e solo cio che contiene oggi. Non dice nulla su cosa conteneva sei mesi fa, quando una determinata scansione potrebbe essere avvenuta.
Dove il vuoto probatorio si fa davvero sentire
Tre situazioni ricorrono spesso non appena si guarda oltre la configurazione iniziale:
- Un restyling del sito o una migrazione del CMS sovrascrive il file robots.txt, e la vecchia direttiva di opt-out scompare senza alcuna traccia locale di quando e stata rimossa o di cosa dicesse in origine.
- Una controversia verte sulla tempistica. Un fornitore di modelli sostiene che l'addestramento sia precedente alla vostra riserva; voi ritenete il contrario. Senza uno snapshot datato del vostro segnale di opt-out, la questione diventa chi e piu convincente, non cosa e dimostrabile.
- L'opt-out cambia nel tempo, per esempio passando da un blocco generico via robots.txt a una politica TDMRep piu granulare che riserva i diritti per l'addestramento dell'IA pur continuando a consentire l'indicizzazione nei motori di ricerca. Se una scansione e avvenuta tra due versioni, solo uno storico datato delle versioni indica quale politica fosse effettivamente in vigore in quel momento.
Nessuno di questi casi e ipotetico. Sono le conseguenze ordinarie della gestione di un sito web attivo per piu di qualche mese. Un opt-out leggibile da dispositivo automatico risolve il problema "una macchina puo leggerlo". Non fa nulla per il problema "potete dimostrare che era vero in una data specifica", ed e proprio questa seconda domanda a decidere una controversia.
Cosa deve garantire una prova datata
Una prova di opt-out difendibile richiede tre elementi che un file robots.txt attivo da solo non puo fornire: uno snapshot del file o del tag esatto cosi come pubblicato, una marca temporale proveniente da una fonte che non controllate voi stessi, e un modo per una terza parte, anche fuori dall'UE, di verificare entrambi senza doversi fidare della vostra parola. Sigillare un hash datato del vostro robots.txt, della vostra dichiarazione TDMRep o del vostro tag meta HTML ogni volta che pubblicate o aggiornate costruisce questa prova in modo incrementale, nel momento esatto in cui ogni versione viene messa online, invece che a posteriori, quando e troppo tardi per ricostruirla.
Ed e proprio qui che il valore della prova conta anche oltre l'UE. Una controversia sui dati di addestramento o una trattativa di licenza con un fornitore di modelli non si svolgera sempre davanti a un'autorita dell'UE. Puo finire davanti al team legale di un laboratorio di IA statunitense, un collegio arbitrale internazionale, o un tribunale in una giurisdizione che non ha mai sentito parlare della direttiva DSM. Una prova la cui unica forza sta in "fidatevi dei nostri log del server" non regge in quella sede. Una prova qualificata e datata in modo indipendente si, perche il suo valore probatorio non dipende da quale giurisdizione lo richiede. E la stessa logica che vale per qualsiasi documento che potreste dover difendere fuori dal paese in cui lo avete creato: una prova che regge a livello globale vale piu di una che funziona solo in casa propria.
Cosa conservare nella prova
Uno snapshot sigillato utile non deve essere complicato. Conservate almeno il testo integrale della direttiva robots.txt o della dichiarazione TDMRep cosi come pubblicata, l'URL o il sottodominio a cui si applicava, e la data in cui e entrata in vigore. Le organizzazioni piu grandi che gestiscono piu proprieta, sottodomini regionali o versioni linguistiche dello stesso sito dovrebbero sigillare ciascuna separatamente, perche una riserva impostata su un dominio non si estende automaticamente a un altro, e un crawler che ha ignorato la politica di un sottodominio non sara scusato da una riserva esistente solo sul sito principale. Se al vostro team legale o di conformita viene chiesto di produrre prove durante un audit o una trattativa di licenza, avere un file datato per ciascuna proprieta e meglio che ricostruire uno storico da pagine in cache e supposizioni.
Vale la pena conservare la prova anche dopo aver modificato o rimosso un opt-out. Se in seguito decidete di concedere in licenza i vostri contenuti per l'addestramento dell'IA anziche bloccarli, uno storico datato che mostra esattamente quando la riserva e stata ritirata vi protegge dal problema opposto: l'accusa di essere ancora in opt-out quando in realta avevate gia concesso il permesso.
Renderlo un'abitudine editoriale normale
La soluzione pratica e piu piccola di quanto sembri. Trattate il vostro segnale di opt-out per il TDM come trattereste un contratto o un file di progetto datato: sigillatelo nel momento in cui cambia, conservate la prova sigillata separatamente dal sito attivo, e ripetete il processo ogni volta che la politica viene aggiornata, non solo una volta al lancio. Per le organizzazioni che pubblicano dataset, documentazione dei modelli o termini di licenza insieme ai propri contenuti, la stessa disciplina si applica anche a quel materiale. La nostra pagina sulla documentazione della provenienza dei dati di addestramento IA spiega come costruire una prova datata e verificabile lungo l'intero ciclo di vita di un dataset, non solo per il segnale di opt-out ai suoi margini.
L'articolo 4, paragrafo 3, vi da il diritto di riservare i vostri contenuti. Non vi da la prova di aver esercitato quel diritto in un momento preciso. Costruite voi stessi la prova datata, prima di averne bisogno, e l'opt-out significhera davvero cio che afferma.
Iniziate a sigillare i vostri segnali di opt-out per il TDM e i vostri record dei dataset con una marca temporale datata e verificabile in modo indipendente, cosi la prova e pronta prima che una controversia vi costringa a ricostruirla.





