AI公司为获取训练数据正在销毁珍稀书籍

一场悄然进行的知识拆解
近日,Hacker News 上一则题为《AI companies are shredding rare books》(AI公司正在销毁珍稀书籍)的讨论引发了技术社区的广泛关注,短时间内获得 88 个赞和 34 条评论。这条讨论揭示了一个鲜为人知却颇具争议的现象:为了获取高质量的训练语料,一些 AI 公司和数据提供商正在大规模拆解、扫描乃至销毁纸质书籍——其中不乏珍稀版本。

这一现象的背后,是当前大语言模型对高质量文本数据的巨大渴求。当前主流大语言模型(如GPT-4、Claude、Llama等)的训练数据量已达到数万亿token的规模。OpenAI的GPT-3在2020年使用了约3000亿token进行训练,而到2024年,前沿模型的训练数据规模已增长了一个数量级以上。这种对数据量的指数级增长需求,源于Scaling Laws(缩放定律)的研究发现——模型性能与训练数据量之间存在幂律关系,增加数据几乎总能带来可预测的性能提升。然而,互联网上可用的高质量英文文本总量是有限的,研究机构Epoch AI估计,高质量语言数据可能在2026年前后被耗尽。随着互联网公开文本被抓取殆尽,且面临越来越多的版权诉讼与合规压力,纸质书籍中蕴含的、经过专业编辑和校对的高质量内容,正成为 AI 训练数据的新目标。
为什么要"毁书"扫描:破坏性扫描的效率与成本
破坏性扫描的运作方式
对于批量数字化书籍而言,最快、最经济的方式恰恰是"破坏性扫描"(destructive scanning)。具体操作是先将书籍的装订切除,把书页拆散成单张,然后通过高速文档扫描仪连续进纸完成数字化。工业级设备如Fujitsu fi系列或Kodak i5000系列高速扫描仪,配合自动进纸器(ADF),每分钟可扫描100-200页。整个流程通常包括:使用工业切纸机(guillotine cutter)将书脊切除约3-5毫米以释放书页,然后将散页放入扫描仪进纸槽。
相比之下,采用平板扫描仪逐页翻拍的"非破坏性"方式,速度慢、人力成本高得多。非破坏性扫描使用V型书托和高分辨率相机(如Internet Archive使用的Scribe系统),每页需要人工翻页和对焦,效率仅为破坏性扫描的1/10到1/20。Internet Archive的Open Library项目在其数字化过程中主要采用非破坏性方式,但速度和成本的劣势使其难以匹配商业公司的数据采集规模。
在追求规模和速度的 AI 数据采集场景下,破坏性扫描成了默认选项。一本书被切开、扫描、丢弃的整个流程可以高度自动化,单位成本被压缩到极低。当目标是数以百万计的书籍时,这种效率优势就显得尤为诱人。
书籍文本数据的稀缺价值
书籍文本在 AI 训练语料中具有特殊地位。相比网络上充斥的低质量、重复甚至 AI 生成的内容,出版书籍经过了专业的写作、编辑和事实核查,语言规范、逻辑连贯、知识密度高。这类"干净"的长文本对于提升大语言模型的语言能力和知识准确性至关重要。
随着高质量公开数据日益枯竭,业界甚至出现了"数据墙"(data wall)的担忧——可用的优质训练数据可能在未来几年内耗尽。在这一背景下,图书馆和旧书市场中的存量书籍,成了尚未被充分开发的"数据金矿"。
AI训练数据已形成一个复杂的供应链生态。上游有专门的数据经纪商和数据标注公司(如Scale AI、Appen等),中间层有数据清洗和质量控制服务,下游则是各大AI实验室。在这个链条中,书籍扫描通常由专业的文档数字化服务商执行,如1DollarScan等公司提供按页计费的扫描服务。一些报道指出,数据经纪商会从旧书店、图书馆除籍(deaccessioned)书籍、遗产拍卖等渠道大量收购实体书,再批量数字化后将文本数据打包出售给AI公司。这种多层外包结构使得AI公司可以与实际的书籍销毁行为保持距离,同时也导致了对书籍文物价值评估环节的系统性缺失。
争议核心:珍稀书籍销毁带来的文化遗产代价
不可逆的文物损失
引发最强烈情绪的,是"珍稀书籍"(rare books)被销毁这一事实。普通的、大量印刷的现代书籍即便被拆解,其内容依然可以从其他渠道获取,物理损失相对有限。但珍稀书籍、绝版书、限量版乃至具有历史价值的印刷品,一旦被切割销毁,其作为实物文物的价值将永久消失。
从文献学和图书馆学的角度看,珍稀书籍的价值远不止于其文本内容。一本书作为物质载体承载着多重信息层次:纸张的材质和水印可以揭示其产地和年代;装帧工艺(如手工缝线、鎏金书口)反映了特定时期的出版技术;书中的批注、藏书印、题跋构成了独特的流传史(provenance);甚至书页的磨损模式也能告诉研究者哪些章节被频繁翻阅。根据美国珍本书商协会(ABAA)的标准,"珍稀"的判定考虑因素包括:现存数量、历史重要性、物理状态、市场需求等。一旦实体被销毁,这些维度的信息将永久丧失,数字化副本只能保留文本和图像这两个维度。
在 Hacker News 的评论区,这种做法被许多人视为一种文化上的短视——用不可再生的文化遗产,去喂养一个商业化的 AI 模型。数字化保存了文本内容,却无法保留书籍作为物质载体所承载的历史信息、装帧工艺和收藏价值。
技术社区的分歧与反思
讨论中也存在不同声音。一部分技术从业者认为,如果是大量存在的普通书籍,破坏性扫描以换取内容的永久数字化保存,反而是一种"抢救"——毕竟纸质书会随时间腐朽,而数字副本可以无限复制传播。争议的焦点其实在于"哪些书值得物理保留"以及"由谁来做这个判断"。
真正的问题在于筛选机制的缺失:在大规模、自动化的数据采集流程中,很难对每一本书进行文物价值评估。当扫描工作外包给追求吞吐量的服务商时,珍稀书籍与普通书籍很可能被同等对待、一并送入切纸机。
更深层的行业隐忧:版权灰色地带与数据焦虑
AI训练数据的版权合规困境
通过购买实体书再扫描的方式获取训练数据,某种程度上是 AI 公司规避版权风险的一种策略——"我买了这本书"似乎提供了某种正当性。但用书籍内容训练商业模型是否构成合理使用,在法律上仍是高度不确定的灰色地带。
美国版权法第107条规定的"合理使用"(Fair Use)原则包含四个考量因素:使用目的和性质、受版权保护作品的性质、使用部分占整体的比例、对作品潜在市场的影响。AI训练是否构成合理使用,目前尚无定论。2023-2024年间,多起标志性诉讼正在推进:《纽约时报》诉OpenAI案、Authors Guild诉OpenAI案、Getty Images诉Stability AI案等。支持者援引Google Books案(Authors Guild v. Google, 2015)的先例,认为将整本书数字化以建立搜索索引属于"转换性使用"。反对者则认为,AI模型能够生成与训练数据高度相似的文本,这直接损害了原作的市场价值。欧盟的《AI法案》和《数字单一市场版权指令》则采取了不同的监管路径,要求明确的版权例外条款支持。
数据焦虑驱动下的行为失范
这一现象本质上反映了整个 AI 行业在数据获取上的焦虑与失序。当数据被视为核心竞争力时,获取数据的手段就可能突破一些原本被默认的社会规范和文化底线。销毁珍稀书籍只是其中一个极端表现,它提醒我们思考:在 AI 狂飙突进的过程中,我们是否正在以未被充分讨论的代价,换取模型能力的边际提升?
值得注意的是,这种数据焦虑并非没有技术上的替代方案。合成数据(synthetic data)生成、数据增强技术、以及更高效的训练算法(如通过改进数据质量过滤来减少所需总量)都是活跃的研究方向。然而,在当前的竞争格局下,这些技术上的长期解决方案往往让位于短期的数据囤积冲动。
结语:数据可以复制,被切碎的珍本无法重来
《AI 公司正在销毁珍稀书籍》这一话题之所以触动人心,是因为它将抽象的"数据采集"具象化为一个令人不安的画面:切纸机的刀刃落在一本可能独一无二的书上。技术进步与文化保护之间的张力,在这里被极端地凸显出来。
或许我们无法阻止书籍数字化的大趋势,但至少应当建立起对珍稀文献的识别与保护机制,让不可逆的销毁行为受到应有的约束。数据可以复制,而被切碎的珍本无法重来。
核心要点
相关推荐

Agent智能体开发入门:从概念到实战的完整指南
深入解析AI Agent智能体的核心架构与开发实战,涵盖自动化营销、智能客服、投资分析三大落地场景,以及单智能体与多智能体协作机制,帮助初学者快速掌握Agent开发思维与实践路径。

Codex五分钟建站真相揭秘:不是AI做网站,是AI帮你抄网站
揭秘短视频平台上火爆的Codex五分钟建站内容真相:博主们并非用AI原创网站,而是复制共享提示词或直接扒别人网站。了解AI编程工具的真实能力边界,别被焦虑营销带节奏。

提示词工程入门指南:从单次指令到系统化方法论
提示词工程零基础入门教程,详解提示词的四大作用、提示词与提示词工程的核心区别、六步系统化流程,以及必须了解的技术与落地局限性,帮你真正发挥AI的全部潜力。