行业资讯

珍稀图书遭粉碎用于AI训练引争议

Heooo 08月02日08时01分 25 阅读

「近期,大量珍稀图书被集中粉碎用于AI训练的消息引发广泛关注。图书数据库ISBNdb因曾提供相关服务而成为舆论焦点,已删除测试页面并声明不训练AI模型。此前Anthropic的“巴拿马计划”也曾购买图书后销毁,引发对AI训练数据来源的讨论。业内人士指出,AI公司为获取高质量数据,不惜采取争议性做法。」

本周,一则关于大量珍贵图书被集中粉碎、仅为训练大语言模型提供数据的消息,在读书爱好者和普通网友中引发轩然大波。据IT之家报道,多家图书供应商近期收到了数量异常庞大的图书订单,业内人士猜测,这些订单背后的买家很可能是AI公司,它们希望获得质量更高、更干净的训练数据,同时尽可能规避版权风险。

这场争议的焦点指向了图书数据库网站ISBNdb。外界认为,该网站不仅鼓励这种做法,甚至还为AI公司与图书供应商之间牵线搭桥。随着舆论迅速发酵,ISBNdb开始试图与这场争议划清界限,并删除了自己此前发布的相关内容。ISBNdb在最新声明中表示:“我们已经注意到近期关于网站上一则营销落地页的报道,也理解它所引发的担忧。我们并不训练AI模型,也从未从事过相关业务。那个页面只是一次市场需求测试,相关服务从未真正上线,目前我们已经将页面删除。”

几天前,404 Media报道称,多家图书供应商突然接到大量图书采购订单。由于学校和图书馆近年来预算紧张、采购需求下降,不少供应商经营压力较大,因此更容易接受这类大额订单。当时外界普遍怀疑幕后买家是AI公司,而ISBNdb则成为舆论焦点,因为它曾推出一项服务,似乎专门帮助AI企业与图书仓储机构建立联系。如今已经删除的宣传页面上曾写道:“世界上最优质的AI训练数据,就摆放在书架上。图书承载着经过筛选、同行评审和专业领域沉淀的人类知识,其结构化程度是任何网络爬虫都无法复制的,内容密集、经过编辑且具有权威性。”

事实上,这一做法并非首次曝光。早在今年1月,一份公开的法庭文件就披露了Anthropic内部代号为“Project Panama(巴拿马计划)”的项目。该项目旨在尽可能购买大量图书,完成数字化扫描后再将实体书销毁。Anthropic此后与作者达成了一项总额15亿美元(现汇率约合101.47亿元人民币)的和解协议。不过,随后公开的法庭文件显示,这种做法本身被认为是合法的,真正让公司担忧的是由此带来的负面舆论。因此,Anthropic愿意支付高额代价,以避免相关做法被曝光。

如今,这一内幕已经公开,因此近期出现的大量珍贵图书采购订单也受到了更严格的关注。一位匿名图书卖家在接受404 Media采访时表示:“这么做既能帮我清理那些本来就很难卖出去的库存,也能让我赚到钱。但另一方面,我并不喜欢这些图书最终的用途,也不愿意看到一些稀有图书被直接打成纸浆。”

报道称,随着AI公司越来越难获得“干净”的训练数据,它们正在寻找新的数据来源。互联网上大量低质量内容,以及越来越多由AI自己生成的内容,都可能导致模型训练出现“负反馈循环”问题。因此,各家公司希望获取质量更高的数据,同时又尽量避免引发外界关注。今年夏天,电影公司A24就宣布与谷歌达成合作,为DeepMind提供训练素材,希望帮助其媒体生成模型摆脱大量质量低劣、风格混乱的AI内容。

至于为何要销毁实体书,报道认为,这并不是为了掩盖痕迹,也不是出于收藏稀有知识的目的。虽然“巴拿马计划”的相关文件并未说明销毁图书的具体原因,但最可能的解释仍然是为了降低成本。实际上,图书数字化扫描并不一定需要破坏原书,但如果整个流程追求低成本、高效率,就很可能直接拆掉书脊,以获得更平整、更清晰的扫描效果,随后再将已经损坏的书籍当作废纸处理。

# AI训练数据 # 图书粉碎 # ISBNdb # Anthropic # 数据获取

来源:Heooo AI工具导航