AirTag追踪揭秘:亚马逊疑似销毁珍本书训练AI

一场用AirTag展开的调查
当技术记者把一枚苹果AirTag塞进一本稀有书籍时,他们或许没想到,这枚小小的追踪器会揭开AI训练背后一个鲜为人知的角落。苹果AirTag是一种基于超宽带(UWB)技术和蓝牙低功耗协议的小型追踪设备,它利用苹果的"查找"(Find My)网络——一个由全球超过十亿台苹果设备组成的众包定位系统——来实现物品的持续定位追踪。任何附近的苹果设备都会在后台匿名中继AirTag的加密位置信号至云端,这使得即使追踪器本身没有GPS或蜂窝网络连接,也能在全球范围内被精确定位。
据科技新闻媒体404 Media的调查,记者与一位书商达成协议,在一本将作为批量订单发货的稀有书籍中放置了AirTag。404 Media是2023年由四位前Vice旗下Motherboard科技频道的资深记者创立的独立科技新闻机构,以深度调查报道著称,专注于技术对社会的影响,其采用读者订阅制的商业模式,不依赖广告收入,在一定程度上保障了编辑独立性。追踪数据显示,这本书最终抵达了位于内华达州拉斯维加斯的亚马逊AI训练设施。
这一发现之所以引发广泛关注,是因为它触及了当下AI行业最敏感的话题之一:训练数据从何而来,又以何种代价获取。如果调查属实,那么一批具有收藏价值的实体书籍,可能正在被拆解、扫描,然后销毁——仅仅为了满足大型语言模型对文本数据的巨大胃口。

为什么AI公司需要书籍数据
高质量文本资源日益稀缺
要理解这一事件的背景,首先要理解书籍对AI训练的独特价值。大型语言模型的能力很大程度上取决于训练数据的质量。当前主流大型语言模型的训练数据规模已达到万亿级token——以GPT-4为例,据业界估计其训练数据可能超过13万亿token。然而,互联网上可用的高质量英文文本总量是有限的。研究机构Epoch AI在2022年的研究中曾警告,到2026年前后,高质量语言数据可能会被"耗尽"。这种被称为"数据墙"(data wall)的现象正在迫使AI公司寻找新的数据来源,包括合成数据生成、多模态数据转化,以及将实体世界的文本资源数字化。
相比互联网上充斥的碎片化、低质量内容,书籍代表了人类知识中经过编辑、结构完整、逻辑严密的高质量文本。无论是文学作品、学术专著还是专业参考书,书籍中的长篇连贯叙事和深度论证,恰恰是模型学习复杂推理和语言表达所需要的素材。研究表明,在高质量书籍语料上训练的模型,在逻辑推理、长文本生成和事实准确性方面明显优于仅在网页数据上训练的模型。这也是为什么众多AI公司都在想方设法获取图书数据——从公开的图书数据集(如Books3,包含约19.6万本书籍),到与出版商谈判授权,再到如今疑似出现的实体书扫描销毁。
从实体到数字:破坏性扫描的代价
将实体书转化为训练数据,最高效的方式往往是"破坏性扫描"(destructive scanning)。具体流程通常包括:首先使用工业切纸机将书脊切除,使书页完全分离为散页;然后将散页送入高速文档扫描仪,这类工业级设备每分钟可扫描100-200页,远超人工翻页扫描的效率;扫描后的图像再通过光学字符识别(OCR)技术转换为可编辑的文本数据。相比之下,非破坏性扫描需要操作者逐页翻阅、对齐,通常每分钟仅能处理数页,效率差距可达数十倍。Google Books项目早期也曾大量采用破坏性扫描方法,但其通常处理的是图书馆中有多份副本的普通馆藏,而非孤本或稀有版本。
对于普通书籍,这或许无可厚非,但当被处理的对象是稀有书籍甚至珍本时,问题的性质就截然不同——这意味着不可再生的文化载体在数字化过程中被彻底摧毁。
这一做法引发了哪些争议
版权与数据来源的法律灰色地带
这起事件再次将AI训练数据的合法性问题推上风口浪尖。围绕AI训练数据的法律争议已在全球多个司法管辖区展开。在美国,核心争议焦点在于"合理使用"(Fair Use)原则的适用范围——美国版权法第107条允许在评论、教育、研究等场景下未经授权使用受版权保护的作品,但商业性AI训练是否属于"变革性使用"(transformative use)仍存在巨大争议。近年来,从《纽约时报》起诉OpenAI(指控ChatGPT能几乎逐字复述其付费文章),到大量作家、艺术家发起的集体诉讼,围绕"AI公司是否有权使用受版权保护的作品进行训练"的争论从未停歇。在欧盟,《人工智能法案》和《数字单一市场版权指令》则为权利人提供了"选择退出"(opt-out)机制;日本则采取了相对宽松的立场,其2018年修订的版权法明确允许为机器学习目的使用受版权保护的材料。
即便一本书是合法购买而来,将其内容用于商业AI模型训练是否构成侵权,在法律上仍是尚未厘清的模糊地带。根据美国版权法中的"首次销售原则"(First Sale Doctrine),购买者有权转售或处置其购买的实体副本,但这一权利并不延伸至对内容的复制和商业再利用。购买一本书的所有权,并不等同于获得了将其内容用于任何商业用途的授权,尤其是当这种用途可能与原作者的商业利益产生直接冲突时。
文化遗产面临不可逆损失
如果说版权问题还有讨论空间,那么销毁稀有书籍所带来的文化损失则更令人痛心。在古籍收藏和图书馆学领域,"稀有书籍"的价值评估基于多个维度:版本稀缺性(现存副本数量)、历史意义(首版、作者签名本、重要批注本)、物理状态(装帧工艺、纸张材质、印刷技术的历史见证),以及出处(provenance,即所有权流转历史)。一本19世纪的首版书籍,其价值可能远超其文字内容本身——它是特定时代印刷技术、设计美学和文化传播方式的实物证据。
稀有书籍之所以珍贵,不仅在于其文字内容,更在于其作为实体存在的历史价值、版本价值和收藏价值。美国古书商协会(ABAA)对稀有书籍有严格的鉴定标准,许多稀有书籍是不可替代的文化遗产。一旦被裁切销毁,这些价值将永久消失,再无恢复可能。
用一件不可再生的文化文物,去换取一段可以被无限复制的数字数据,这笔交易在很多人看来是本末倒置的。它折射出当前AI竞赛中一种令人担忧的倾向:为了追求数据规模和模型性能,一些参与者可能正在忽视更长远的文化与伦理代价。
这起事件带来的深层启示
数据饥渴时代的伦理边界在哪里
这次调查的意义,超越了单一公司的行为本身。它揭示了一个正在快速逼近的现实:随着高质量训练数据日益稀缺,AI公司获取数据的手段可能会越来越激进。当公开数据被"榨干",实体世界的资源便可能成为下一个目标。业界已经观察到多种应对"数据墙"的策略:有的公司投资合成数据生成技术,用AI自身产出训练数据;有的与Reddit、新闻机构等内容平台签订高价授权协议;还有的探索将视频、音频等多模态数据转化为文本。而直接将实体书籍数字化,可能是其中最粗暴也最具争议的一种方式。
记者用AirTag这种消费级追踪设备来揭露AI供应链背后的做法,本身就颇具象征意义——普通人手中的技术工具,正在成为监督科技巨头的利器。这一调查手法让人联想到环保组织追踪非法捕捞船队、或记者追踪电子垃圾出口流向的经典调查案例。这也提醒我们,AI行业的透明度问题亟需更多来自外部的持续监督。
行业规范和监管框架亟待建立
这起事件呼唤更明确的行业规范和监管框架。至少应当在以下几个层面建立共识:
- 训练数据的来源应当可追溯、可披露
- 具有文化价值的实体资料在数字化时应优先采用非破坏性方式
- 对稀有、绝版书籍应建立特殊的保护机制
目前,部分国家和地区已开始在这一方向上迈出步伐。欧盟《人工智能法案》要求高风险AI系统披露训练数据摘要;美国国会也在讨论多项涉及AI训练数据透明度的法案。但在文化遗产保护与AI训练数据获取之间如何平衡,全球尚未形成成熟的规范体系。
有意思的是,目前这一调查主要来自404 Media单一媒体的报道,相关公司尚未对此做出全面回应,具体的规模和是否为系统性行为仍有待进一步验证。但无论是个案还是普遍现象,它所引发的讨论都值得整个行业认真对待。
结语
从一枚小小的AirTag,到一座AI训练设施,再到一本被销毁的稀有书籍——这条追踪链条串联起的,是AI时代数据获取的伦理困境。技术进步固然重要,但当它以不可逆的文化损失为代价时,我们有必要停下来追问:这样的代价,是否真的值得?在追求更强大AI的道路上,如何守住文化遗产保护和版权伦理的底线,将是所有从业者无法回避的课题。
相关推荐

从Cursor切换到Claude Code的实战避坑指南
详解从Cursor迁移到Claude Code的核心差异与避坑策略,涵盖操作习惯适配、上下文机制重建、风险控制三步法及调试排查技巧,帮助开发者顺利完成从AI代码助手到自主智能体的范式跨越。

monolog:无需整理的AI笔记应用,语义搜索找回一切
monolog是一款取消文件夹和标签的AI笔记应用,用户只需像聊天一样记录想法,AI自动理解内容并通过语义搜索帮你找回信息。支持iOS、Android、Web等全平台同步。

AI编程助手为何这么烧钱?揭秘Harness背后的真实账单
深度解析AI编程助手Claude Code、Cursor、Cline等工具的隐形成本结构,揭示系统提示词、Agent往返震荡和Prompt缓存如何影响你的账单,提供实用的成本优化策略。