媒体起诉AI巨头引发行业深忧
「西雅图时报与新闻日报联合起诉OpenAI和微软,指控其未经授权使用新闻内容训练AI系统,声称生成式AI如同“蛇吞自身尾巴”,可能摧毁新闻业生态。此案引发广泛关注,此前纽约时报等媒体也已发起类似诉讼。」
随着生成式人工智能迅速渗透到内容生产领域,新闻机构与AI企业之间的版权矛盾正在不断加剧。近日,《西雅图时报》与《新闻日报》两家新闻机构联合对OpenAI和微软提起诉讼,指控这两家科技巨头不当使用受版权保护的新闻内容来训练其AI模型。这是继纽约时报等媒体相继发起法律行动之后,又一起备受瞩目的行业争端。
在这份诉讼文件中,原告方表达了极为深刻的忧虑。他们认为,随着AI技术的普及,新闻行业可能面临“无法修复的破坏”。诉讼中用了一个形象的比喻,将生成式人工智能描述为“一条吞噬自己尾巴的蛇”,认为它最终可能摧毁那些原本为它提供训练素材的原创内容生产机构。这一表述生动揭示了新闻生产与AI训练之间存在的循环悖论:AI依赖人类创作的内容而成长,而这种成长又反过来威胁到内容生产者的生存基础。
诉讼进一步指出,像ChatGPT和Copilot这样的AI产品在宣传中被定位为内容的创造者,但实际上它们更像是贪婪的消费者。它们大量吞噬人类撰写的文章,经过模型处理后,再向世界输出基于原文的复制品或衍生模仿物。原告认为,这种行为的背后是明确商业目的,而这些AI公司从未为获取原始内容支付合理的授权费用,也未能对原创者的劳动给予应有的尊重。
事实上,新闻行业与科技巨头之间的紧张关系并非始于今日。早在2023年,《纽约时报》就已就版权侵犯问题起诉OpenAI及其合作伙伴兼投资者微软。随着案件进展,越来越多的出版物选择站到同一阵线。此次《西雅图时报》的起诉更因其特有的背景而格外引人关注——微软和OpenAI此前曾资助过该报的部分新闻项目和研究金计划。这种合作历史与当前对簿公堂的局面形成鲜明反差,也让事件多了几层复杂意味。
面对新一轮诉讼,微软方面通过发言人对媒体作出了回应。发言人表示,公司“对此次诉讼感到意外”,但同时也表达了开放解决争端的姿态,称“乐意坐下来探讨解决这类纠纷的方案”。这一回应虽然简短,却透露出科技巨头在应对版权质疑时常见的矛盾心态:一方面不承认侵权行为的定性,另一方面又希望避免陷入长期法律战带来的不确定性和声誉损耗。
从技术角度审视,此类诉讼的核心争议点在于:AI模型训练中使用公开或搜集到的文本数据,是否属于合理使用范畴。在自然语言处理技术的发展历程中,大规模语料库一直是模型能力的基础。无论是早期的统计语言模型,还是后来基于Transformer架构的预训练模型,都需要大量真实世界的文本作为学习对象。新闻内容因其语言质量高、信息密度大、表达结构严谨,长期被视为优质训练语料。然而,当AI系统能够生成与原文高度相似的输出,甚至在某些情况下逐字复述训练集中出现过的段落时,传统的版权例外原则便面临巨大挑战。
这起诉讼的意义并不局限于个案的胜负。它引发了一个更加宏观的行业议题:在生成式AI时代,如何重新设计内容创作与使用的补偿机制。如果新闻机构的原创内容被系统性用于训练商业AI模型,而这些模型又反过来分流了读者对原文的访问,那么新闻业的商业模式将面临根本性冲击。若所有新闻机构都因收入枯竭而缩减采编规模,整个社会的公共信息质量也将随之下降。
目前,OpenAI和微软尚未就诉讼细节发表完整的法律回应,但已有迹象表明,部分科技企业开始尝试通过授权协议与新闻出版商合作。例如,某些公司已与大型媒体集团签署内容授权条款,允许其在一定范围内使用新闻报道用于AI训练。这类商业安排能否成为解决矛盾的普适路径,仍有待观察。而司法判决的态度,则可能影响未来数年内AI训练数据获取的规则走向。
无论结果如何,这场围绕内容归属权与AI技术边界的争论,已经促使更多AI开发者反思训练数据伦理。一些开源社区和模型研发机构开始强调数据来源透明化,并尝试构建遵循授权协议的语料集。对整个行业而言,从无序爬取走向合规协作,或许是技术成熟之外另一条必经之路。
来源:Heooo AI工具导航