行业资讯

美媒起诉OpenAI与微软侵犯训练版权

Heooo 09月05日20时34分 6 阅读

「《西雅图时报》和《新闻日报》正式起诉OpenAI与微软,指控其未经授权抓取新闻报道用于训练AI。诉讼称AI可复现原文内容,削弱读者访问媒体网站的必要性。OpenAI回应基于公开数据训练,微软则寻求坦诚沟通。原告要求销毁侵权作品及训练数据集。」

近日,《西雅图时报》与《新闻日报》两家美国媒体正式对人工智能公司OpenAI及科技巨头微软提起版权诉讼。据公开报道,该诉讼已提交至美国纽约南区联邦地区法院,指控两家公司未经许可擅自复制其新闻报道,并将这些内容用于训练和驱动ChatGPT、微软Copilot以及必应AI检索等人工智能产品。

起诉书指出,OpenAI和微软在抓取网站内容时,不仅覆盖了公开页面,还绕过了付费墙,获取了原本仅供付费订阅用户阅读的专属内容。这些文章随后被直接整合入训练数据集,成为AI模型知识来源的一部分。媒体方面表示,涉案AI产品能够完整复现报道中的原文段落,也能进行高度雷同的文本改写,甚至直接向用户提供综合性的答案。这种行为极大地削减了用户访问媒体官网或进行付费订阅的必要性,对新闻机构的商业模式造成了实质性冲击。

针对这一诉讼,OpenAI发言人回应称,其模型均基于公开数据训练,并且符合“合理使用”原则,但未对本次诉讼中的具体指控作详细置评。微软发言人则在电子邮件中表示:“尽管这起诉讼令我们感到意外,但我们高度认可地方新闻报道的重要性。我们始终愿意与各方坦诚沟通,共同寻求解决此类纠纷的方案。”这一表态被外界解读为微软倾向于通过对话协商来解决争议,而非单纯对抗。

从技术角度看,这起案件再次将AI训练数据版权问题推向风口浪尖。当前主流大语言模型依赖海量文本数据进行预训练,新闻网站往往因其高质量、结构化且信息密集的特点,成为数据抓取的重要来源之一。然而,新闻内容本身承载着版权保护,其与AI训练之间的边界一直存在争议。此前已有作家、画家、编程开发者等群体对AI公司发起类似诉讼,但媒体机构作为系统性内容生产者,其对整个新闻生态的影响更为深远。

原告方目前正寻求法院发布命令,要求涉事公司全面销毁所侵权作品的副本,以及任何包含这些内容的训练数据集和AI模型。如果该请求获得支持,将可能对AI模型的既有训练流程产生重大影响,甚至迫使企业重新评估其数据采集策略。不过,从行业实践来看,销毁已训练完成的模型权重在技术上极为复杂,法律执行层面也面临诸多挑战。因此,此案更可能的方向是推动双方达成版权授权或补偿协议,进而形成媒体内容与AI训练之间的合规授权机制。

对于开发者生态而言,这一诉讼也释放出明确信号:在构建AI应用时,数据来源的合法性与合规性将不再是可以忽视的灰色地带。未来,基于公开许可的语料库、与内容方签订授权协议,以及引入更透明的数据溯源机制,可能成为AI训练的基础规范。此次诉讼的进展,值得关注AI技术发展、内容创作业及法律界持续跟踪。

# AI版权 # OpenAI # 微软 # 训练数据

来源:Heooo AI工具导航