珍本图书流向AI训练设施:数据版权争议与行业透明度困境

一批珍本图书的神秘旅程
近日,一则来自 Hacker News 社区的报道引发了关于 AI 训练数据来源的广泛讨论。报道标题直指核心:《我们追踪了一批珍本图书的运输,它最终抵达了亚马逊的 AI 训练设施》(We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility)。
这则追踪报道触及了当下生成式 AI 发展中最敏感的问题之一——训练数据的来源与合法性。当稀有、绝版甚至具有历史价值的纸质书籍被成批运往科技巨头的数据处理设施,人们不禁追问:这些图书究竟经历了什么?它们的内容将如何被使用?

实体书籍为何成为AI训练的目标
从数字文本到实体扫描
在大语言模型的训练中,文本数据是最核心的"燃料"。早期的模型主要依赖互联网上已经数字化的公开文本,例如维基百科、新闻网站、开源代码库等。然而,随着模型规模的持续膨胀,高质量的公开文本资源正在快速枯竭。
这一现象在业界被称为"数据墙"(data wall)问题。根据 DeepMind 团队在 2022 年提出的 Chinchilla 缩放定律,训练一个最优模型所需的 token 数量应与模型参数量成正比——一个拥有千亿参数的模型理论上需要数万亿 token 的高质量训练数据。这一缩放定律源自DeepMind发表的论文《Training Compute-Optimal Large Language Models》,其核心发现颠覆了此前业界"越大越好"的参数竞赛思路:在固定计算预算下,同步增加模型参数和训练数据量才能获得最优性能。具体而言,模型参数每翻一倍,训练token数也应大致翻倍,这意味着GPT-4级别的模型可能需要超过13万亿token的训练数据,而下一代模型的数据需求将更为惊人。
据研究机构 Epoch AI 估算,互联网上可公开获取的高质量文本数据总量约在 4.6 万亿到 17 万亿 token 之间,而当前最先进的模型已经接近甚至超越了这一上限。虽然合成数据(即由 AI 模型自身生成的训练数据)被视为一种潜在替代方案,但研究表明纯合成数据训练可能导致"模型坍塌"(model collapse),即模型输出的多样性和质量逐代退化。模型坍塌的概念由牛津大学和剑桥大学的研究团队在2023年的论文《The Curse of Recursion》中系统阐述:当AI模型使用前代模型生成的合成数据进行训练时,每一代都会丢失原始数据分布中的低概率事件和长尾信息,经过多代迭代后,模型输出会逐渐收敛到一个越来越窄的分布范围内,表现为生成内容的同质化、创意丧失和事实准确性下降。这一发现从根本上证明了真实的、人类创作的高质量文本依然不可替代。
业界普遍认为,优质的书籍文本——尤其是经过专业编辑、结构严谨、知识密度高的出版物——对于提升模型的语言能力和知识深度具有不可替代的价值。当唾手可得的数字文本被消耗殆尽后,科技公司开始将目光投向尚未被数字化的实体书籍。
珍本图书的独特语料价值
报道中特别提及的是"珍本图书"(rare books)。这类书籍往往包含在网络上难以找到的独特内容:绝版著作、专业领域的深度资料、历史文献等。对于追求数据多样性和稀缺性的 AI 训练而言,这些内容恰恰是极具吸引力的"新鲜语料"。
将实体书籍进行扫描、OCR 识别并转化为可训练文本,正在成为一些机构补充训练数据的手段。现代 OCR(光学字符识别)技术已经相当成熟,结合深度学习的 OCR 系统对印刷体文字的识别准确率可达 99% 以上,即便对于老旧印刷品或特殊字体也能实现较高的还原度。值得注意的是,书籍语料用于 AI 训练并非全新现象——此前曝光的 Books3 数据集就包含了约 19.6 万本通过影子图书馆(shadow libraries)获取的电子书,被多家 AI 公司用于训练,并引发了大规模的版权诉讼。所谓影子图书馆,是指Z-Library、Library Genesis(Libgen)、Sci-Hub等未经授权提供受版权保护作品免费下载的在线平台。Books3数据集由研究者Shawn Presser于2020年创建,从Bibliotik(一个私人种子追踪器)中提取了约19.6万本商业出版的电子书,总计约100GB文本,被纳入了广泛使用的The Pile训练数据集,被Bloomberg、Meta等多家公司用于训练大语言模型。2023年,多位作家据此提起诉讼,Books3最终从公开渠道下架,成为AI训练数据版权争议的标志性案例之一。
相比于从灰色地带的电子资源中获取数据,直接采购和扫描实体书籍在操作层面更具"可控性",但这并不意味着它在法律上就是安全的。这一过程虽然技术上并不复杂,但其中涉及的版权和伦理问题却相当棘手。
AI训练数据版权的灰色地带
合理使用还是版权侵权?
围绕 AI 训练数据的版权争议,近年来在全球范围内持续升温。多家出版商、作家团体已对领先的 AI 公司提起诉讼,核心争议点在于:未经授权将受版权保护的作品用于训练商业 AI 模型,是否构成侵权。
AI 公司通常援引"合理使用"(fair use)原则进行辩护,主张训练过程是对原始内容的"转化性使用"(transformative use)。合理使用原则可追溯至1841年美国法院在Folsom v. Marsh案中确立的判例法原则,后于1976年正式写入《版权法》第107条。而"转化性使用"的概念则由联邦最高法院在1994年Campbell v. Acuff-Rose Music案中确立——该案涉及嘻哈组合2 Live Crew对Roy Orbison歌曲的戏仿,法院指出使用行为越具有转化性,就越可能被认定为合理使用。美国版权法第 107 条规定了判定合理使用的四项要素:(1)使用的目的和性质,包括是否具有商业性质或转化性;(2)受版权保护作品的性质;(3)使用部分相对于整体的数量和实质性;(4)该使用对原作品潜在市场的影响。AI 公司强调训练过程将原始文本"转化"为统计模式和权重参数,模型并不"存储"原文,因此属于高度转化性使用。而权利人则认为,模型实质上是在从受保护的创作成果中获取商业价值,理应获得授权或补偿。将统计学习过程定性为"转化性使用"在法律界仍存在巨大分歧,这一概念能否从传统的戏仿、评论等场景延伸到机器学习领域,将是未来判例的关键看点。
目前全球范围内已有多起重大诉讼正在推进。《纽约时报》于 2023 年底对 OpenAI 和微软提起诉讼,指控其未经授权使用数百万篇新闻文章训练模型;数千名作家(包括约翰·格里沙姆、乔治·R·R·马丁等知名作者)通过美国作家协会对 OpenAI 提起集体诉讼。这些案件的判决结果将在很大程度上决定 AI 训练数据使用的法律边界。
值得注意的是,各国对此的立法态度存在明显差异,呈现出显著的分化路径。日本在 2018 年修订的《著作权法》第30条之四中明确规定,为机器学习等"非享受"目的使用受版权保护的内容不构成侵权,且不设退出机制,立法意图是将日本打造为AI研发的友好环境。欧盟《数字单一市场版权指令》(DSM Directive)则采取折中路线,第3条和第4条分别规定了研究目的和商业目的的文本数据挖掘例外,但商业用途的挖掘允许权利人通过机器可读方式声明保留权利,赋予了"退出"(opt-out)的选择权。英国曾考虑引入类似日本的宽泛例外,但在出版业的强烈反对下于2023年搁置了这一计划。这些差异化的立法路径反映了各国在促进AI创新与保护创作者权益之间的不同权衡取舍。
这则珍本图书追踪报道之所以引发关注,正是因为它将抽象的版权争议具象化——不再是网络上无形的文本抓取,而是可以被物理追踪的、实实在在的图书运输。
实体扫描用于AI训练的法律风险
对实体书籍进行扫描本身并非新鲜事。谷歌图书(Google Books)项目多年前就曾大规模扫描图书馆藏书,并因此陷入长达十年的法律纠纷,最终法院认定其扫描并提供片段检索的行为属于合理使用。
谷歌图书案(Authors Guild v. Google, 2015)的判决逻辑具有重要参考意义。这一案件有着漫长而曲折的法律历程:谷歌图书项目始于2004年,谷歌与密歇根大学、哈佛大学、斯坦福大学等多所高校图书馆合作,计划扫描数千万册藏书。2005年,美国作家协会和美国出版商协会分别提起诉讼。案件经历了漫长的和解谈判——2008年达成的和解协议因被法院认定涉及过宽的权利让渡而于2011年被驳回。案件最终走向判决:2013年纽约南区联邦法院Chin法官裁定谷歌的行为构成合理使用,2015年第二巡回上诉法院维持原判,2016年最高法院拒绝受理上诉。
联邦第二巡回上诉法院认为,谷歌扫描图书并提供有限片段(snippet)的行为具有"高度转化性",因为它创造了一种全新的功能——搜索和发现——而非替代原作品的阅读体验。法院还特别指出,由于仅展示有限片段,该行为不会对原作品的销售市场产生实质性替代。然而,AI 训练的情形与此存在关键差异:训练过程通常需要摄入作品的完整内容(即便最终模型不逐字存储),且训练后的模型可以生成与原作品在风格、结构甚至内容上相似的输出,从而可能直接与原作品形成市场竞争。法院在谷歌图书案中也明确强调其判决仅限于谷歌的具体使用方式,并不意味着所有大规模数字化行为都自动获得合理使用的庇护。
因此,将扫描内容用于训练可生成竞争性内容的 AI 模型,与提供检索片段有着本质区别。前者可能直接影响原作品的市场价值,其法律定性远比谷歌图书案更加复杂和不确定。合理使用四要素中的第四项——"对原作品潜在市场的影响"——很可能成为此类案件中最具争议的焦点。
训练数据透明度缺失的行业困境
训练数据构成仍是"黑箱"
当前主流 AI 模型的训练数据构成,大多处于高度不透明的状态。厂商出于商业竞争和潜在法律风险的考量,往往对具体的数据来源讳莫如深,外部监督几乎无从下手。
这一透明度缺失与学术界推动的最佳实践形成了鲜明反差。早在 2018 年,研究者就提出了"数据集数据表"(Datasheets for Datasets)倡议,主张每个用于机器学习的数据集都应附带详细文档,说明其创建动机、数据构成、收集过程、预处理方法以及潜在偏见。谷歌后来推出的"模型卡片"(Model Cards)也建议公开披露模型的训练数据来源和评估结果。然而在实践中,OpenAI 的 GPT-4 技术报告中对训练数据的描述仅有寥寥数句,声称出于"竞争环境和安全考量"不予详述。Meta 的 LLaMA 系列虽然更为开放,但其数据来源声明也经常被批评过于笼统。只有少数完全开源的项目(如 EleutherAI 的 The Pile 数据集)对训练数据构成进行了较为详尽的记录。
正因如此,通过物理追踪运输这样的"侦探式"调查方式,反而成为了外界窥探 AI 数据来源的少数途径之一。这本身就折射出行业透明度的严重缺失,也说明公众对 AI 训练数据来源的关切正在不断升温。
亟待建立的行业规则与补偿机制
随着此类事件不断被曝光,建立更清晰的行业规则已成为迫切需求。可能的方向包括:训练数据来源的强制披露、对受版权保护内容的授权机制,以及对原创作者的合理补偿方案。
在监管层面,各方已经开始行动。欧盟《人工智能法案》(AI Act)于 2024 年正式生效,其中第53条专门针对通用人工智能模型(GPAI)设定了透明度义务,要求提供者必须提供训练数据的"足够详细的摘要",包括所使用的训练数据集及其来源的描述。欧盟AI办公室随后发布的实施准则进一步细化了这一要求,建议采用标准化模板记录数据集的规模、来源类别、时间跨度、语言分布和许可状态。对于被认定具有"系统性风险"的高能力GPAI模型,还需进行更严格的评估和报告,违反透明度义务的罚款最高可达全球年营业额的3%或1500万欧元。美国版权局也在 2023 年至 2024 年间举行了多次关于 AI 与版权问题的公开听证会和公众意见征集,试图厘清现行法律框架在 AI 时代的适用边界。
在行业实践方面,一些机构已经开始探索数据授权的商业模式,这一市场正在快速形成规模。OpenAI 先后与美联社、Axel Springer(《世界报》母公司)、法国《世界报》等媒体机构达成了内容授权协议;Shutterstock 和 Getty Images 分别推出了面向 AI 训练的图像授权计划,并承诺向贡献者分享收益。Reddit 则以每年约 6000 万美元的价格向谷歌授权其平台内容用于 AI 训练。不同类型的内容提供者正在采取差异化的定价策略:新闻媒体通常按年签订固定费用的授权协议,用户生成内容平台则倾向于按数据量或API调用量计费。据估计,AI训练数据授权市场的规模可能从2023年的数亿美元快速增长到2027年的数十亿美元。
然而,这种模式也引发了批评:它可能加剧数据市场的集中化,大型内容平台获得丰厚回报,而个人创作者——尤其是其作品已被训练使用的独立作者和艺术家——可能被完全排除在补偿体系之外。Spotify模式下音乐人获得的微薄分成就是一个值得警惕的前车之鉴。这些探索或许代表了未来更可持续的方向——让内容创作者从 AI 的价值创造中获得应有的回报。但挑战在于,对于已经被使用的数据如何追溯补偿,以及中小创作者如何在谈判中获得公平地位,这些问题仍有待更系统化的解决方案。
结语:AI时代不可回避的数据伦理命题
一批珍本图书的运输轨迹,意外地照亮了生成式 AI 产业链中一个被长期忽视的角落。它提醒我们,无论技术如何先进,AI 的智能归根结底建立在人类积累的知识之上。
当这些承载着人类智慧结晶的书籍被投入训练设施时,我们需要认真思考:如何在推动技术进步的同时,尊重知识创造者的权益,维护健康的知识生产生态。这不仅是法律问题,更是关乎 AI 时代基本伦理的根本命题。
需要说明的是,本文基于 Hacker News 社区的单一来源报道进行分析,报道的具体细节和涉及方的正式回应仍有待进一步核实。但它所引发的关于 AI 训练数据来源的讨论,无疑具有普遍的现实意义。
相关推荐

EmbeddedSass for .NET:告别Node.js依赖的Sass编译方案
EmbeddedSass for .NET基于官方Embedded Sass协议,让.NET开发者无需Node.js即可原生编译Sass/SCSS。本文解析其技术原理、应用场景及与ASP.NET生态的集成方式。

旧金山到新加坡时差:硅谷科技人的跨太平洋日常
旧金山与新加坡之间存在15-16小时时差,频繁往返两地已成为科技从业者的常态。本文解析SF到SG时差挑战、两大科技中心的连接趋势,以及AI行业全球化布局背后的人才与资本流动。

Anthropic官方Claude Code插件目录发布:精选高质量扩展生态
Anthropic发布官方Claude Code插件目录claude-plugins-official,提供经过审核的高质量插件精选集。了解官方目录的定位、核心价值及对AI编程工具生态的深远影响。