行业资讯

亚马逊切书脊扫描图书训练AI模型

Heooo 08月17日23时34分 26 阅读

「调查人员用AirTag追踪发现,亚马逊仓库团队为提高效率切掉书脊扫描纸质书,原书被毁,数据用于训练Nova模型。Anthropic也有类似“巴拿马计划”。法院裁定此类扫描属合理使用,但珍贵原书消失引发知识封存争议。」

人工智能公司训练大模型需要海量数据,当互联网上的文本被“榨干”后,纸质书籍成为新的数据金矿。近日一项调查揭示,亚马逊正在系统性地购入纸质书籍,通过切除书脊的方式快速扫描,将内容转化为AI训练语料,而原书则在这一过程中被直接销毁。

调查人员将苹果AirTag藏入一批珍贵书籍的货件中,一路追踪这些书在美国境内的去向。最终,货件抵达亚马逊位于拉斯维加斯的一座仓库,仓库内有一支名为VGT3的团队,其标志是一只手持书本的霸王龙。据该团队成员透露,为了提高扫描效率,他们会先切掉书脊,然后进行批量扫描。这意味着,这些书在被数字化后,原本的实体版本已无法继续留存于公共书架。

亚马逊随后使用扫描得到的数据训练自家Nova模型。面对质疑,亚马逊发言人表示,公司通过正常商业渠道采购书籍,用于改进产品。但一些书商怀疑,AI公司正在按照ISBN编号,系统性地逐本扫描过去出版过的书籍。纸质书的价值尤其高,因为大量内容从未出现在互联网上,而且许多书籍出版于2022年以前,其中不含AI生成内容,作为训练数据更为“纯净”。

采取这种方式的不只有亚马逊。Anthropic此前也曾进行类似项目,图书作者提起的诉讼中披露了其内部的“巴拿马计划”:从电商平台购入书籍,切除书脊,再将内容数字化。审理该案的法官裁定,这类扫描属于合理使用,不构成版权侵权。裁决的一项关键依据是:纸质原件已经被销毁,因此不存在原书复制后再出售的情况,这反而使“合理使用”的辩护更容易成立。

争议的焦点在于,一些被销毁的原书可能根本无法替代,尤其是一些珍稀版本或绝版书籍。它们原本承载的知识本可留在公共领域,如今却只被封存在单一公司的封闭AI模型内部。这种做法虽然符合现行法律,但引发了关于文化保存、知识垄断与技术伦理的深层担忧。随着AI训练数据需求持续膨胀,如何平衡技术发展与传统知识资产保护,正成为行业必须面对的课题。

# 亚马逊 # AI训练数据 # 书籍扫描 # AirTag # Anthropic

来源:Heooo AI工具导航