AI公司大规模扫描稀有书籍引发争议
「近期,多家AI公司被曝大规模扫描稀有书籍用于训练模型,引发版权和文化遗产保护争议。这些公司通过数字化馆藏、私人藏书甚至盗版网站获取文本,无视版权限制和书籍的稀有性。此举虽加速了AI发展,却可能破坏书籍的物理完整性,并导致知识传播的垄断。业界呼吁建立更透明的数据采集规范,平衡技术进步与文化遗产保护。」
随着大语言模型对训练数据的需求激增,AI公司正将目光投向稀有书籍——那些难以获取、版权模糊甚至濒临失传的印刷品。据Hacker News社区披露,多家知名AI企业被指系统性地扫描图书馆特藏、私人藏书和二手市场的绝版书,以扩充其训练语料库。这一做法在技术圈和出版界引发激烈讨论。
稀有书籍通常指印量少、馆藏分散或具有特殊历史价值的出版物。它们往往受版权法保护,但部分已进入公共领域。然而,AI公司的大规模数字化行为并未获得明确授权。有报道称,某些公司通过合作机构获取扫描权限,但更多案例显示,它们直接购买实体书后拆解扫描,甚至利用盗版网站的数据集。例如,一个名为“Books3”的语料库就包含大量受版权保护的书籍,被多家AI公司用于训练。
这种行为对物理书籍的破坏不可忽视。稀有书籍的纸张脆弱,频繁扫描可能加速其老化。图书馆员和收藏家担心,AI公司的“一次性”数字化会导致书籍受损,而后续保存却无人负责。更严重的是,一旦书籍被扫描并纳入私有模型,原版可能被丢弃或遗忘,造成知识传承的断层。
从技术角度看,AI公司需要海量高质量文本以提升模型性能。稀有书籍中的专业术语、历史语境和独特叙事,对训练模型的深度理解能力至关重要。然而,版权问题成为最大障碍。多数国家的版权法并未明确涵盖AI训练这一场景,导致法律灰色地带。一些公司主张“合理使用”原则,认为训练属于非商业研究,但版权持有者认为这侵犯了其复制权和发行权。
出版界和文化机构对此反应强烈。国际出版商协会呼吁建立全球性的AI训练数据许可框架,确保作者和出版社获得合理补偿。同时,数字图书馆如HathiTrust和Internet Archive开始限制AI公司的访问权限,要求其签署更严格的使用协议。一些大学图书馆甚至禁止AI公司进入特藏室扫描。
开源社区则提出另一种解决方案:构建由社区维护的公共领域语料库,避免依赖私有数据。例如,Project Gutenberg和Wikisource已提供大量免费文本,但覆盖范围有限。有开发者建议,AI公司应优先使用这些开放数据,或与文化遗产机构合作,以透明的方式数字化稀有书籍。
这场争议的核心在于技术进步与文化保护之间的平衡。AI公司追求模型性能无可厚非,但若以牺牲人类知识遗产为代价,则可能引发更广泛的信任危机。未来,行业需要更明确的规则:哪些书籍可以扫描?如何确保数字化后的物理保存?训练数据的使用是否应公开透明?这些问题的答案,将决定AI是成为知识的守护者还是掠夺者。
来源:Heooo AI工具导航