如果贵机构在网上发布文本、图片或其他内容,您很可能已经对AI公司是否应被允许将这些内容用于训练其模型有自己的看法。自2019年起,欧盟法律赋予权利人一种正式的拒绝方式:依据DSM指令第4条规定的文本与数据挖掘退出机制。大多数已经设置了该机制的发布者认为,只要robots.txt中的一行代码或网站上的TDMRep标签生效,任务就算完成了。这只是容易的一半。真正决定退出声明在争议中能否站得住脚的困难一半,是证明它在何时生效以及具体内容是什么。
第4条实际赋予了什么权利
DSM指令第4条创设了一项例外,允许为文本与数据挖掘目的复制和提取合法可访问的作品,在很大范围内的情况下无需许可。第4条第3款随后划定了对权利人真正重要的界限:只有在权利人未明确保留其权利的情况下,该例外才适用。对于在线公开提供的内容,这种权利保留必须以"适当方式,例如机器可读的方式"表达。简单来说,页面某处的一段文字说明是不够的。这种权利保留必须能够被实际执行挖掘的爬虫和处理系统读取,这也是为什么大多数实现方式依赖于robots.txt指令、HTML元标签,或专为此目的开发的文本数据挖掘保留协议(TDMRep)。
设置这个信号是一次性的技术任务。保留其证明则不是,而这正是大多数权利人止步的地方。
为何退出声明现在真正有分量,以及这为何提高了风险
有几年时间,第4条第3款在很大程度上只是一种理论上的保护。随着欧盟AI法案的出台,这种情况发生了变化。投放于欧盟市场的通用人工智能模型提供者现在需要承担一项直接义务,该义务规定于AI法案第53条,即制定合规政策以遵守欧盟版权法,特别是识别并遵守依据DSM指令第4条第3款表达的权利保留。无论模型提供者的注册地在何处,或实际训练在何处进行,只要该模型投放于欧盟市场,这项义务就适用。
这使退出声明从一种被动的法律地位,转变为双方现在都必须主动应对的问题。模型提供者必须证明其已核查并遵守了该权利保留。而您作为权利人,可能需要证明在内容被收集用于训练之前,该权利保留已以正确形式存在。这两个问题都关乎某个具体的时间点,而不是您网站的当前状态。robots.txt文件永远只能显示它今天包含的内容,无法说明它六个月前是什么样子,而某次特定的抓取可能正是在那时发生的。
证据缺口实际影响之处
一旦超越最初的设置去看,有三种情况会反复出现:
- 网站改版或CMS迁移覆盖了robots.txt文件,旧的退出指令消失得无影无踪,没有任何本地记录能说明它是何时被移除的,或者原本写的是什么。
- 争议围绕时间点展开。模型提供者声称训练运行发生在您做出权利保留之前;您则认为并非如此。如果没有对您的退出信号进行带日期的快照记录,这就会变成一场关于谁的说法更有说服力的较量,而不是关于什么能被证明的问题。
- 退出声明会随时间变化,例如从robots.txt的一刀切式禁止,转变为更精细的TDMRep政策,在继续允许搜索引擎索引的同时为AI训练保留权利。如果某次抓取发生在两个版本之间,只有带日期的版本历史才能说明当时实际适用的是哪个政策。
这些情况没有一个是假设性的边缘案例。它们是运营一个存活超过几个月的网站所带来的普通后果。机器可读的退出声明解决了"机器能否读取"的问题,但对"您能否证明这在某个特定日期是真实的"这个问题毫无帮助,而正是这第二个问题才真正决定争议的结果。
一份带日期的记录需要具备什么
一份站得住脚的退出记录需要三样东西,而这些是一个实时的robots.txt文件本身无法提供的:所发布的确切文件或标签的快照、来自您自己无法控制的来源的时间戳,以及一种让第三方,包括欧盟以外的第三方,无需仅凭您的说辞就能核实这两者的方式。每次发布或更新时,对robots.txt、TDMRep声明或HTML元标签进行带日期的哈希封存,就能逐步建立这份记录,在每个版本上线的那一刻完成,而不是等到事后已经无法重建时才去补救。
这也是底层证明的价值超出欧盟范围而变得重要的地方。关于训练数据的争议,或与模型提供者的许可谈判,并不总是在欧盟主管机构面前展开。它可能会摆到一家美国AI实验室的法务团队、一个国际仲裁小组,或一个从未听说过DSM指令的司法辖区法院面前。一份唯一依据是"请相信我们的服务器日志"的证明,在那样的场合中站不住脚。而一份合格且经独立日期验证的记录则可以,因为它的证明价值不取决于是哪个司法辖区在质询。这与您可能需要在制作地之外的国家为之辩护的任何文件所适用的逻辑是一样的:能够在全球范围内站得住脚的证明,比只在本国有效的证明更有价值。
记录中应保留哪些内容
一份有用的封存快照不需要很复杂。至少应保留robots.txt指令或TDMRep声明的完整文本,与发布时完全一致,它所适用的URL或子域名,以及它上线生效的日期。管理多个站点、区域子域名或同一网站多语言版本的大型机构,应分别对每一个进行封存,因为在一个域名上设置的权利保留不会自动扩展到另一个域名,而忽略了某个子域名政策的爬虫,也不会因为主站点存在的权利保留而被免责。如果贵机构的法务或合规团队在审计或许可谈判中被要求提供证据,为每个站点保留一份带日期的文件,远胜于从缓存页面和猜测中重建历史。
即使在修改或撤销退出声明之后,保留这份记录同样值得。如果您后来决定将内容许可用于AI训练而不是屏蔽它,一份能准确显示权利保留何时被撤销的带日期历史记录,可以保护您免受相反问题的困扰:即被指控在实际上已经授予许可之后,仍处于退出状态。
将其变成一种日常发布习惯
实际的解决办法比听起来要简单。像对待合同或带日期的设计文件那样对待您的文本数据挖掘退出信号:在它变更的那一刻将其封存,将封存记录与实时网站分开保存,并在每次政策更新时重复这一过程,而不是只在上线时做一次。对于随内容一同发布数据集、模型文档或许可条款的机构而言,同样的规范也适用于这些材料。我们关于AI训练数据溯源记录的页面详细介绍了如何在整个数据集生命周期中建立带日期、可验证的记录,而不仅仅是针对边缘的退出信号。
第4条第3款赋予您保留内容权利的资格。但它并未赋予您证明您在某个具体时间点行使了该权利的证据。在需要之前就自行建立这份带日期的记录,退出声明才会真正名副其实。
立即开始为您的文本数据挖掘退出信号和数据集记录加盖带日期、可独立验证的时间戳,这样在争议迫使您重建证据之前,证明就已经准备就绪。





