政策法规

微软备忘录称AI训练是最大规模劳动窃取

Heooo 09月19日12时34分 28 阅读

「《纽约时报》起诉微软与OpenAI的版权纠纷案中,原告申请简易判决并披露被告内部材料。微软应用科学总监赫克特在内部备忘录中称,大型模型吞噬他人劳动成果是“人类历史上规模最大的劳动成果盗窃”;数据显示Copilot使该报点击率最高下降93%,OpenAI内部也承认聊天机器人对出版商构成“生存威胁”。」

据科技媒体报道,《纽约时报》起诉微软与 OpenAI 的版权纠纷案有了新进展。原告已向法院申请简易判决,并同时提交新的法律摘要,进一步披露了两家被告公司的内部材料。这起纠纷可追溯至 2023 年年底,《纽约时报》指控微软和 OpenAI 未经许可使用其数千篇新闻报道,用来训练 ChatGPT 和 Copilot 等产品。

这份简报引用了微软应用科学总监布伦特 · 赫克特于 2023 年 1 月撰写的内部备忘录。据称,赫克特在备忘录中写道,全球数百万人很快就会认为,大型模型“吞噬”他们所有的劳动成果是一种前所未有的惊人盗窃,他更直接称之为“人类历史上规模最大的劳动成果盗窃”。另一份微软文件也指出,几乎没有人希望自己创作的内容被以这种方式使用,他们也没有因此获得任何补偿。

数据层面的证据同样被提交。随着 ChatGPT 在 2023 年迅速走红,微软自身的数据显示,与 Bing 搜索相比,Copilot 导致《纽约时报》的点击率最高下降 93%。赫克特在另一份备忘录中把这种局面称为“恶性循环”,认为它将同时损害模型自身的性能和整个互联网。他写道,最终产品威胁到其关键供应商的经济基础,这种情况极为罕见,而这正是大语言模型业务在“内容供应链”方面造成的局面。

OpenAI 的内部沟通内容也被一并引用。ChatGPT 负责人尼克 · 特利表示,AI 聊天机器人对出版商构成“生存威胁”,因为它们“在很大程度上是替代性的”,而且随着技术进步,替代性只会越来越强。另一位工程师则坦言,无论链接展示得多么醒目,用户都不会点击。研究员尼克 · 莱德还向公司总裁格雷格 · 布罗克曼透露了一个绕过《纽约时报》付费墙的技巧,布罗克曼的回应是“啊,不错”。

从技术与产业角度看,这起案件把大模型训练数据的来源、授权与内容生态的可持续性问题推到了台前。模型能力的提升高度依赖高质量语料,而语料的生产者却可能因为模型提供的替代性答案而失去流量与收入,形成输入与回报不对等的结构性矛盾。如何在训练数据获取、内容引用与创作者利益之间建立更清晰的规则,正在成为生成式 AI 规模化落地过程中绕不开的技术与商业课题。

# AI训练数据 # 版权纠纷 # 大语言模型 # 内容生态

来源:Heooo AI工具导航