Wer online Texte, Bilder oder andere Inhalte veroeffentlicht, hat sich wahrscheinlich schon eine Meinung dazu gebildet, ob KI-Unternehmen diese Inhalte fuer das Training ihrer Modelle nutzen duerfen sollten. Seit 2019 gibt das EU-Recht Rechteinhabern eine formelle Moeglichkeit, dies abzulehnen: den Opt-out fuer Text- und Data-Mining nach Artikel 4 der DSM-Richtlinie. Die meisten Verlage, die diesen Mechanismus eingerichtet haben, halten die Aufgabe fuer erledigt, sobald eine robots.txt-Zeile oder ein TDMRep-Tag auf der Website aktiv ist. Das ist die einfache Haelfte der Aufgabe. Die schwierige Haelfte, die tatsaechlich entscheidet, ob der Opt-out im Streitfall standhaelt, ist der Nachweis, wann er aktiv war und was genau er besagte.
Was Artikel 4 tatsaechlich gibt
Artikel 4 der DSM-Richtlinie schafft eine Ausnahme, die die Vervielfaeltigung und Entnahme rechtmaessig zugaenglicher Werke fuer Text- und Data-Mining erlaubt, ohne dass in vielen Faellen eine Lizenz noetig ist. Artikel 4 Absatz 3 zieht dann die fuer Rechteinhaber massgebliche Grenze: Die Ausnahme gilt nur, wenn der Rechteinhaber seine Rechte nicht ausdruecklich vorbehalten hat. Bei online oeffentlich zugaenglichen Inhalten muss dieser Vorbehalt "in angemessener Weise, etwa durch maschinenlesbare Mittel" erfolgen. Ein Hinweistext irgendwo auf einer Seite reicht also nicht. Der Vorbehalt muss fuer die Crawler und Pipelines lesbar sein, die das Mining tatsaechlich durchfuehren, weshalb sich die meisten Umsetzungen auf eine robots.txt-Direktive, ein HTML-Meta-Tag oder das eigens dafuer entwickelte TDM Reservation Protocol (TDMRep) stuetzen.
Dieses Signal zu setzen ist eine einmalige technische Aufgabe. Den Nachweis dafuer zu bewahren, ist es nicht, und genau dort hoeren die meisten Rechteinhaber auf.
Warum der Opt-out jetzt Biss hat und warum das den Einsatz erhoeht
Ein paar Jahre lang blieb Artikel 4 Absatz 3 weitgehend eine theoretische Absicherung. Das aenderte sich mit dem EU AI Act. Anbieter von KI-Modellen mit allgemeinem Verwendungszweck, die auf dem EU-Markt bereitgestellt werden, unterliegen nun einer direkten Pflicht nach Artikel 53 des AI Act, eine Strategie zur Einhaltung des EU-Urheberrechts einzurichten und insbesondere Rechtsvorbehalte nach Artikel 4 Absatz 3 der DSM-Richtlinie zu erkennen und einzuhalten. Diese Pflicht gilt unabhaengig davon, wo der Modellanbieter ansaessig ist oder wo das eigentliche Training stattfand, solange das Modell auf dem EU-Markt bereitgestellt wird.
Das macht aus dem Opt-out eine passive Rechtsposition, um die sich beide Seiten nun aktiv kuemmern muessen. Ein Modellanbieter muss zeigen, dass er den Vorbehalt geprueft und respektiert hat. Sie als Rechteinhaber muessen unter Umstaenden nachweisen, dass der Vorbehalt in der richtigen Form vorlag, bevor die Inhalte fuer das Training gesammelt wurden. Beides sind Fragen zu einem bestimmten Zeitpunkt, nicht zum aktuellen Zustand Ihrer Website. Eine robots.txt-Datei zeigt immer nur, was heute dort steht. Sie sagt nichts darueber, was dort vor sechs Monaten stand, als ein bestimmter Crawl vielleicht stattgefunden hat.
Wo die Beweisluecke tatsaechlich zuschlaegt
Drei Situationen tauchen immer wieder auf, sobald man ueber die anfaengliche Einrichtung hinausblickt:
- Ein Website-Relaunch oder eine CMS-Migration ueberschreibt die robots.txt-Datei, und die alte Opt-out-Direktive ist verschwunden, ohne dass lokal nachvollziehbar ist, wann sie entfernt wurde oder was sie urspruenglich besagte.
- Ein Streit dreht sich um den Zeitpunkt. Ein Modellanbieter behauptet, der Trainingslauf sei vor Ihrem Vorbehalt erfolgt; Sie glauben das Gegenteil. Ohne eine datierte Momentaufnahme Ihres Opt-out-Signals wird das zu einer Frage, wer ueberzeugender argumentiert, statt einer Frage dessen, was belegbar ist.
- Der Opt-out aendert sich mit der Zeit, zum Beispiel von einem pauschalen robots.txt-Disallow hin zu einer feineren TDMRep-Richtlinie, die Rechte fuer KI-Training vorbehaelt, waehrend die Suchindexierung weiterhin erlaubt bleibt. Fand ein Crawl zwischen zwei Versionen statt, verraet nur eine datierte Versionshistorie, welche Richtlinie zu diesem Zeitpunkt tatsaechlich galt.
Keiner dieser Faelle ist ein hypothetisches Randproblem. Es sind die gewoehnlichen Folgen, wenn eine Website laenger als ein paar Monate im Betrieb ist. Ein maschinenlesbarer Opt-out loest das Problem "kann eine Maschine das lesen". Fuer das Problem "koennen Sie beweisen, dass das an einem bestimmten Datum galt" leistet er nichts, und genau diese zweite Frage entscheidet einen Streitfall.
Was ein datierter Nachweis leisten muss
Ein belastbarer Opt-out-Nachweis braucht drei Dinge, die eine live geschaltete robots.txt-Datei allein nicht liefern kann: eine Momentaufnahme der exakten Datei oder des Tags, wie sie veroeffentlicht wurde, einen Zeitstempel aus einer Quelle, die nicht Sie selbst kontrollieren, und eine Moeglichkeit fuer Dritte, auch ausserhalb der EU, beides zu pruefen, ohne Ihnen einfach glauben zu muessen. Wird ein datierter Hash Ihrer robots.txt, Ihrer TDMRep-Erklaerung oder Ihres HTML-Meta-Tags bei jeder Veroeffentlichung oder Aktualisierung versiegelt, entsteht dieser Nachweis schrittweise, genau in dem Moment, in dem jede Version live geht, statt nachtraeglich, wenn eine Rekonstruktion nicht mehr moeglich ist.
Genau hier zeigt sich auch der Wert des zugrunde liegenden Nachweises ueber die EU hinaus. Ein Streit ueber Trainingsdaten oder eine Lizenzverhandlung mit einem Modellanbieter spielt sich nicht immer vor einer EU-Behoerde ab. Er kann bei der Rechtsabteilung eines US-amerikanischen KI-Labors landen, vor einem internationalen Schiedsgericht oder vor einem Gericht in einer Rechtsordnung, die die DSM-Richtlinie nie gehoert hat. Ein Nachweis, der nur so stark ist wie "vertrauen Sie unseren Server-Logs", traegt in diesem Gespraech nicht weit. Ein qualifizierter, unabhaengig datierter Nachweis schon, weil sein Beweiswert nicht davon abhaengt, welche Rechtsordnung fragt. Dieselbe Logik gilt fuer jedes Dokument, das Sie moeglicherweise ausserhalb des Landes verteidigen muessen, in dem Sie es erstellt haben: ein Nachweis, der global standhaelt, ist mehr wert als einer, der nur zuhause funktioniert.
Was in den Nachweis gehoert
Eine nuetzliche versiegelte Momentaufnahme muss nicht kompliziert sein. Halten Sie mindestens den vollstaendigen Text der robots.txt-Direktive oder der TDMRep-Erklaerung genau so fest, wie sie veroeffentlicht wurde, die URL oder Subdomain, fuer die sie galt, sowie das Datum, an dem sie live ging. Groessere Organisationen mit mehreren Webauftritten, regionalen Subdomains oder mehreren Sprachversionen derselben Website sollten jede davon einzeln versiegeln, denn ein auf einer Domain gesetzter Vorbehalt gilt nicht automatisch auch fuer eine andere. Ein Crawler, der die Richtlinie einer Subdomain ignoriert hat, wird nicht durch einen Vorbehalt entschuldigt, der nur auf der Hauptseite existierte. Wird Ihr Rechts- oder Compliance-Team bei einer Pruefung oder einer Lizenzverhandlung um Nachweise gebeten, ist eine datierte Datei pro Webauftritt besser als eine Historie, die aus zwischengespeicherten Seiten und Vermutungen rekonstruiert werden muss.
Es lohnt sich auch, den Nachweis aufzubewahren, nachdem Sie einen Opt-out geaendert oder entfernt haben. Entscheiden Sie sich spaeter, Ihre Inhalte fuer KI-Training zu lizenzieren, statt sie zu sperren, schuetzt eine datierte Historie, die genau zeigt, wann der Vorbehalt zurueckgezogen wurde, vor dem umgekehrten Problem: dem Vorwurf, Sie seien noch abgemeldet gewesen, obwohl Sie die Erlaubnis tatsaechlich bereits erteilt hatten.
Das zur normalen Publikationsgewohnheit machen
Die praktische Loesung ist kleiner, als es klingt. Behandeln Sie Ihr TDM-Opt-out-Signal genauso wie einen Vertrag oder eine datierte Konstruktionsdatei: versiegeln Sie es in dem Moment, in dem es sich aendert, bewahren Sie den versiegelten Nachweis getrennt von der Live-Website auf und wiederholen Sie diesen Vorgang bei jeder Aktualisierung der Richtlinie, nicht nur einmal beim Start. Fuer Organisationen, die Datensaetze, Modelldokumentation oder Lizenzbedingungen zusammen mit ihren Inhalten veroeffentlichen, gilt dieselbe Disziplin auch fuer dieses Material. Unsere Seite zur Dokumentation der Herkunft von KI-Trainingsdaten beschreibt, wie Sie ueber den gesamten Lebenszyklus eines Datensatzes hinweg einen datierten, ueberpruefbaren Nachweis aufbauen, nicht nur fuer das Opt-out-Signal an seinem Rand.
Artikel 4 Absatz 3 gibt Ihnen das Recht, Ihre Inhalte vorzubehalten. Er gibt Ihnen nicht den Nachweis, dass Sie dieses Recht zu einem bestimmten Zeitpunkt tatsaechlich ausgeuebt haben. Bauen Sie den datierten Nachweis selbst auf, bevor Sie ihn brauchen, dann bedeutet der Opt-out auch tatsaechlich das, was er verspricht.
Beginnen Sie damit, Ihre TDM-Opt-out-Signale und Datensatz-Nachweise mit einem datierten, unabhaengig ueberpruefbaren Zeitstempel zu versiegeln, damit der Nachweis bereitsteht, bevor ein Streitfall Sie zur nachtraeglichen Rekonstruktion zwingt.





