亚马逊收购珍稀书籍拆解扫描用于AI训练
「据404 Media报道,亚马逊正大量收购珍稀书籍,切割书脊后扫描用于AI模型训练。调查者在珍稀书中放入追踪设备,最终发现其被送至拉斯维加斯VGT3设施。亚马逊回应称通过商业渠道购书以改善产品服务。珍稀书籍因不含AI生成内容而成为高质量训练数据的宝贵来源。」
据404 Media的调查报道,亚马逊正在系统性地收购大量珍稀书籍,并对其进行破坏性处理——切除书脊后进行高速扫描,将内容转化为大语言模型(LLM)的训练数据。调查人员在一本珍稀书籍中秘密放置了追踪设备,最终追踪结果显示,这本书被送到了位于拉斯维加斯的一处亚马逊设施中。
这个被称为VGT3的设施,门口悬挂着一只恐龙手持书本的标识。面对外界的质疑,亚马逊在一份声明中表示,公司“通过商业渠道购买书籍,以改善客户使用的产品和服务”。短短一句话背后,折射出AI行业对高质量训练数据日益膨胀的渴求。
亚马逊从一家在线书店起家,如今却亲自上演“毁书训模”的行为,颇具象征意义。那些被拆解的珍稀书籍,大多为绝版或无法在互联网上检索到的印刷品。对于需要海量文本“喂养”的大语言模型而言,互联网上能被抓取的内容几乎已被消耗殆尽,而这些传统出版物的纸页,反而成为尚未被开采的数据富矿。
这些旧书之所以极具价值,核心在于其内容的“纯净性”——任何在2022年之前出版的书籍,都不可能是由大语言模型撰写的。当AI模型反复吸收由AI生成的文本时,会引发“模型崩溃”现象,即模型输出质量随AI生成内容的摄入比例升高而显著劣化。训练数据中混入的机器文本越多,模型就越容易退化,最终产生扭曲或有损的回答。因此,人类作者在数字世界诞生之前留下的文字,成为维持模型性能的稀缺资源。
然而,获得这些数据并非没有代价。为了将厚重的纸质文本转换为可机器读取的格式,操作人员必须切除书脊,使书页能被自动进纸扫描仪高速处理。对于图书馆藏中尚存的珍稀善本而言,这样的物理破坏几乎不可逆。一本书一旦被送进VGT3这样的处理中心,便意味着它作为实体书籍的生命就此终结。
值得关注的是,这并非AI行业首次因训练数据来源引发争议。此前,Anthropic就曾被指控非法盗版书籍用于训练。与之相比,亚马逊选择了合法购买的方式,但破坏性的处理流程仍然触动了文化保护者的神经。珍稀印刷品本身就具有不可再生性,而AI公司批量收购的行为,正在加剧这类文献藏品的稀缺。
从技术层面来看,采购珍稀书籍并非低效之举。对于拥有数十亿参数的大模型来说,训练语料的规模与多样性直接决定其推理能力的上限。来自不同年代、不同领域的纸质书籍,在语言风格、知识体系、叙事逻辑上与网络文本存在显著差异。这种差异性,恰恰能帮助模型构建更丰富的语言表征,从而在知识问答、文本生成等任务上表现更佳。
在这一轮AI竞赛中,高质量文本正在成为比算力更隐蔽的壁垒。科技巨头们清楚地认识到,当互联网上的数据被消耗殆尽、当模型生成的文本开始污染下一代模型的训练池时,那些被遗忘在书架上的旧书,反倒成了最后的“优质牧场”。
但以毁坏实体书作为获取数据的代价,终究引发了更深层的思考:当人类文明的印刷遗产被转化为一串串数字参数后,我们收获的是更加智能的机器,还是不断缩水的文化库存?在技术效率与人文留存之间,整个行业也许还需要寻找更具创造性的平衡点。亚马逊的这一操作,让AI训练数据的来源问题再次浮出水面,也让更多人开始审视所谓“智能背后的物质代价”。
来源:Heooo AI工具导航