Skip to main content
AI Technology

AI公司如何证明训练数据来源并应对版权主张

In short

AI公司在训练模型时面临两种截然不同的风险:欧盟《人工智能法案》第10条的数据治理要求,以及针对训练数据的民事版权主张。本文说明一份站得住脚的数据集来源记录究竟需要包含什么,以及对数据集哈希值加盖合格时间戳能够证明什么、不能证明什么。

AI公司如何证明训练数据来源并应对版权主张 — Swiss Trust Layer

任何训练AI模型的团队都会面临两种不同的法律风险,二者来自完全不同的方向。第一种是监管层面的:自2026年8月2日起,欧盟《人工智能法案》第10条要求高风险AI系统的提供者对其训练、验证和测试数据集进行记录,包括数据收集流程及数据来源。第二种是民事层面的:版权持有人可以主张其作品被未经许可使用,此时举证责任落在AI公司身上,需要证明其实际使用了哪些数据,以及这些数据是如何获取的。

这两种风险问的其实是同一个问题的不同版本:数据集里有什么内容、来自哪里、以及你是何时获得的。这个问题在实践中就是“来源”(provenance)的含义所在,而准确厘清一份加盖时间戳的记录能够证明什么、不能证明什么,是很有必要的。

第10条究竟要求什么

第10条适用于高风险AI系统,规定了提供者必须落实的数据治理做法。这些义务涵盖数据收集过程中的设计选择、数据收集流程本身及数据来源、标注、打标签和清洗等预处理步骤、对数据集是否与预期用途相关且具有充分代表性的评估,以及对潜在偏见的审查。如果提供者发现存在妨碍合规的缺口,同样必须予以记录。

这些要求都没有让公司证明自己已经清理了训练集中所有作品的版权。第10条是一套数据质量与治理制度,而不是版权清理制度。但要妥善回应这些要求,所需要的底层记录,与版权抗辩所需要的记录是一致的:纳入了哪些数据、来自哪里、以及何时获得的。

另一种独立的民事风险

针对AI训练行为的版权主张,目前在多个司法辖区都是活跃且持续进行中的诉讼领域,出版商、作者、音乐版权持有人和图片库都曾对主要AI开发商提起诉讼。法律理论因司法辖区和具体案件而异,法院也仍在厘清一些核心问题,例如对受版权保护的材料进行训练是否构成转换性使用,以及许可义务与数据挖掘例外之间应如何互动。我们不会预测任何具体案件的结果,一份训练数据记录本身也无法解决这个问题。

在实践中,这类主张真正取决于的是证据。如果版权持有人主张其作品被未经许可抓取使用,AI公司的应对能力就取决于能否拿出一份并非事后编写的记录,证明其收集了什么、来自哪里、以及在什么条款下收集的。一家无法重建自身数据供应链的公司,只能凭记忆去应对一位提出具体指控的原告。

对数据集而言,“来源”实际意味着什么

一份训练数据集的监管链可以拆解为三个值得分别追踪的要素:

  • 获取记录。某个数据源是何时被加入语料库的,来自哪个URL、API、许可方或供应商,以及当时适用的是该来源条款的哪个版本。
  • 许可记录。是否存在覆盖该使用行为的协议(如果有的话),是直接许可、平台服务条款授权、开放许可,还是依赖诸如《数字单一市场版权指令》第4条之类的文本与数据挖掘例外条款,以及版权持有人是否已通过机器可读的方式针对该例外保留权利。
  • 完整性记录。证明公司今天所指的这份数据集,与其实际训练所用的那份是同一份,而不是为应对争议而事后拼凑重建的版本。

在这三者之中,完整性记录是大多数团队最拿不出好答案的一项。获取记录和许可记录通常散落在各种邮件、供应商合同和内部维基页面中。即便这些记录确实存在,往往也无法证明这些文档中所指的数据集,与模型数月甚至数年后实际训练所用的那批文件是同一批。

合格时间戳能证明什么,不能证明什么

在获取数据集的那一刻,对其加密哈希值进行封存并加盖合格时间戳,可以创建一份站得住脚的记录,证明某组特定字节在某个特定时间点确实存在且由你持有。这是一项范围有限但确实有用的主张。它意味着,即便数月或数年之后,你也能向法院准确展示当初收集数据集时的样貌,而无需仅凭自己的一面之词,也无需依赖一份事后可能被修改过的文件。

必须准确认识这一主张的边界,因为夸大它的作用比不提出它更糟糕。一份封存的哈希值证明的是在某个时间点的存在性和持有状态。它不能证明你拥有使用该内容的许可,也不能证明该内容最初是以合法方式获得的。许可与授权是独立的法律问题,仅凭时间戳无法解答。它真正做到的,是消除整整一类争议,也就是你能否证明自己当初持有什么、何时持有,从而让关于许可条款的实际争论能够基于事实展开,而不是取决于法院愿意相信哪一方对事件的说法。

对于一家面对监管机构就第10条数据治理提出询问、或面对版权持有人主张未经授权使用的公司而言,“这是我们在获取该数据集当天封存的确切数据集加盖时间戳的哈希值,以及我们的许可记录”,与“我们认为这大致就是我们所使用的数据”,二者之间的差别,正是一个站得住脚的立场与一个无法核实的立场之间的差别。

这在实际工作流程中的位置

对于既需要应对第10条治理问题、又需要应对背后版权问题的AI产品开发团队来说,将数据集获取视为一个离散的、经过封存的事件,而不是一个持续变化、可被修改的文件夹,会更为有利。在获取数据集时对其快照进行哈希处理并封存,附上当时适用的许可条款,并将这份记录与后续任何下游清洗或过滤操作分开保存。如果日后就某个特定数据源、特定日期或特定许可产生争议,相关记录早已存在,而不必在压力之下临时重建。

我们的AI数据集来源页面详细介绍了这一流程如何运作,适合那些需要为数据集内容及获取时间提供加盖时间戳、可被法庭采纳的记录,并配合许可文档来回答授权这一独立问题的团队。

查看关于人工智能内容所有权的完整指南

使用 Swiss Trust Layer AG 保护您的作品

使用由 Swisscom Trust Services 支持的司法认可 e-Seal 封存您的知识产权。

预约免费演示

相关文章

如果有人要你证明内容合规,你到底该拿出什么?
AI & Technology

当客户、平台或监管机构要求提供 AI 内容合规证明时,仅有一个披露标签是不够的。真正站得住脚的证据包是:一个时间戳、一个签名、一份内容哈希,以及一个任何人无需联系你就能核验的链接。

2026年8月10日阅读文章
本周回顾:第 50 条、版权举证,以及有什么改变
AI & Technology

第 50 条自 8 月 2 日起适用。围绕它写了一周,最后归结为一个念头:规则要求你作出一项陈述,而陈述的价值,取决于别人要你拿出依据时你能拿出什么。

2026年8月8日阅读文章
每家欧盟出版方都需要的四种人工智能标注,以及各自的含义
AI & Technology

人工智能生成、人工智能修改、人工智能辅助、由人撰写。四种声明几乎涵盖了一个内容团队产出的全部。本文说明它们的区别、如何在一分钟内判断,以及为什么不准确的标注比没有标注更糟。

2026年8月4日阅读文章
打勾不等于证据:人工智能法案下的标注与凭证
AI & Technology

标注与记录在页面上看起来完全一样,一旦有人提出质疑,二者的表现却截然不同。本文说明自我声明与证据的分野、常见的内部痕迹为何补不上这个缺口,以及合格时间戳改变了什么。

2026年8月3日阅读文章
第 50 条今日生效。以下是证明你的内容合规的方法。
AI & Technology

欧盟人工智能法案第 50 条的透明度义务自今日起适用。本文说明该义务实际要求什么、为什么仅有标注会把举证负担留给发布方,以及一份可由外部第三方核验的记录包含哪四个部分。

2026年8月2日阅读文章