行业资讯

一枚AirTag揭露亚马逊丢弃稀有书籍训练AI

Heooo 08月18日04时29分 17 阅读

「通过隐藏式AirTag追踪,媒体发现亚马逊在训练AI模型时,将大量稀有书籍直接丢弃而非数字化。这一做法引发对科技公司数据获取伦理的讨论,业内呼吁建立透明的数据治理机制,在合法合规前提下保护珍贵文化资源。」

近日,一则通过AirTag追踪器揭露的新闻引发行业关注:亚马逊在训练人工智能模型的过程中,被发现在处理一批稀有书籍时采取了丢弃的方式。这一事件由美国科技媒体Ars Technica报道,迅速在开发者社区引发讨论。

AirTag是苹果公司推出的蓝牙追踪设备,通常用于物品定位。此次事件中,有人将AirTag藏入书中,追踪到了亚马逊处理书籍的环节,意外发现这些珍贵的稀有书籍并未进入数字化流程,而是被直接丢弃。这一做法令许多爱书人士和研究人员感到惋惜。

从技术角度看,训练大语言模型需要海量高质量文本。书籍长期以来被视为优质语料来源,尤其是那些绝版或罕见的书籍,往往包含独特的历史、文化和专业知识。亚马逊作为云计算和人工智能领域的重要参与者,理应对这些数据资源抱有敬畏之心。

然而,实际处理过程中的浪费与不透明,引发了外界对科技巨头数据获取方式的质疑。有分析指出,这可能源于版权问题的复杂性——对于无法确定权利归属的图书,企业宁可直接销毁也不愿承担法律风险。这一逻辑虽然合乎商业理性,却难以得到公众理解。

此次事件也反映出AI产业在数据供应链上存在的共性难题。许多公司通过大规模扫描图书、期刊甚至个人网页来积累语料,但资源采集后的处置方式却鲜有监管。稀有书籍的流失不仅是文化的损失,也可能阻碍未来AI模型在特定知识领域的发展。

业内建议,科技公司应当建立更加透明的数据治理机制,例如与图书馆或学术机构合作,在合法合规的前提下让稀有书籍得到数字化保存。同时,对于确无使用价值的书籍,也应考虑捐赠或回收,而非简单丢弃。

随着生成式AI的持续升温,数据来源的可持续性与道德性正成为无法回避的议题。亚马逊的这次教训,或许能推动整个行业重新审视自己的数据策略,在技术进步与文化保护之间寻找更好的平衡。

# AI训练数据 # 亚马逊 # 数据治理

来源:Heooo AI工具导航