联邦法院并未裁定用受版权保护的图书训练AI模型是违法的。它也没有裁定这样做永远合法。在Bartz诉Anthropic案中,加州北区法院划出的界线,比两种说法所暗示的都要窄。用这些图书进行训练,在美国版权法下可能被认定为合理使用,但为了训练而保留这些图书的盗版副本,是另一个独立的行为,而这个独立行为并不受保护。这两个问题之间的区别,材料如何被使用,与材料如何被获取,才是真正决定此案的关键。这也是围绕随后达成的15亿美元和解的大多数报道所忽略的部分。
法院究竟认定了什么
法院审查了两个独立的法律问题。第一,用受版权保护的图书训练大型语言模型,是否属于可以构成合理使用的转化性使用。第二,Anthropic获取用于训练的图书的方式,即从Library Genesis和Pirate Library Mirror下载,这两个都是知名的盗版资源库,这种获取方式本身是否合法。这两个问题的答案并不相同。法院认定,用这些图书训练可能构成合理使用,因为模型是从文本中学习统计模式,而不是复制或分发图书本身。但从盗版网站获取副本并将其保存在一个永久的内部资料库中,并不适用同样的推理。合理使用可以保护对已合法拥有的作品的某些使用,但它不能追溯性地使最初获取该副本的方式合法。正是第二个结论,即关于那个由盗版副本构成的资料库,而非训练本身,导致了责任认定,并塑造了法官Araceli Martinez-Olguin于2026年7月20日批准的和解方案。
这一区分为何在本案之外仍然重要
把这一切简化为"AI训练没问题"或"AI训练是违法的",很有吸引力。这两种说法都不准确,把其中任何一种当作今后已确立的规则,都会误解实际发生的事情。在美国版权法下,合理使用是逐案根据事实认定的:复制了什么,复制了多少,出于什么目的,以及对原作品市场造成了什么影响。Bartz诉Anthropic案是针对一家公司、基于一组具体来源、在一组具体事实下回答这些问题的。它并非涵盖每一家AI公司或每一条训练流程的笼统裁决,面对类似问题的其他法院,完全可以基于不同的事实得出不同的结论。比任何单一判决都更可靠地具有普遍意义的,是这种推理本身的结构:法院提出两个独立的问题,而不是一个。你对材料做了什么,以及,分开来看,你是如何获取它的。即便一家公司可能赢下第一个问题,它仍可能输掉第二个问题。
这对你自己的数据和文件意味着什么
对法务总顾问和合规团队而言,实际的启示并非一条关于AI训练的法律意见。这是一个远早于AI就存在的来源问题。如果你的机构使用AI工具,依赖训练数据,或将内容授权给可能用其训练模型的第三方,值得问的问题不只是某项活动是否被称为训练。而是这些底层材料究竟来自哪里,以及你是否能够证明这一点。建立在合法授权或恰当获取的材料之上的模型,与建立在盗版资料库之上的模型,即便训练方法从外部看起来完全相同,二者所处的法律地位也大不相同。
同样的逻辑反过来也适用于你自己机构创建的材料。能够证明一份文件何时存在、由谁创建、以及此后未被更改,是一项独立的、可证明的事实,与后来有人如何使用它的任何论证无关。这种有时间戳、可核实的记录,本身并不能解决合理使用方面的争议,但它恰恰消除了盗版来源在本案中给Anthropic造成的那种模糊性:关于某样东西究竟来自哪里、追溯到原始版本的链条是否始终清白的模糊性。处理知识产权来源问题的法务和合规团队,无论是否与AI相关风险有关,都可以在Swiss Trust Layer知识产权与法律解决方案页面了解文件的封存和时间戳如何支持清晰的保管链。它不会告诉你某项具体使用是否属于合理使用。它是为了回答那个相邻、也更容易回答的问题而设计的:你能证明你当时拥有什么,以及是在什么时候拥有的。




