微软OpenAI机密文件曝光AI训练数据争议
「微软与OpenAI一批机密内部文件公开,其中微软高管警告将新闻内容用于AI训练是“前所未有的大规模盗窃”,内部文件还提出“毁灭循环”风险,并显示部分新闻机构点击率下降83%至93%。OpenAI方面亦曾确认相关AI产品可能给出版商带来“生存性威胁”。」
随着围绕AI训练数据版权问题的争议持续升温,微软与OpenAI一批此前被标记为机密的内部文件正式公开。这些文件披露了两家公司内部员工对生成式AI与新闻内容之间关系的担忧,也揭示出AI产品与内容提供方之间正在形成的紧张关系。
其中,微软应用科学部门主管Brent Hecht在多份内部文件中提出了相当激烈的判断。他警告称,将新闻内容用于AI训练是“前所未有的大规模盗窃”,甚至称其可能是“人类历史上规模最大的劳动力盗窃”。在另一份文件里,他还对微软和OpenAI所主张的“合理使用”观点提出质疑,认为大规模抓取新闻内容的做法,可能与合理使用所依据的理念相悖。
微软内部文件还提出了所谓“毁灭循环”的风险:AI产品不断削减新闻网站的流量与收入,导致新闻机构减少内容生产,而AI模型自身也会因此失去可靠的信息来源。微软的内部数据似乎已经反映出这一趋势:部分涉诉新闻机构的点击率下降了83%至93%,另一些机构则下降了51%至94%。新闻机构还援引ChatGPT搜索结果点击率偏低以及自身流量下滑的情况,认为AI聊天机器人正在逐步取代用户直接访问新闻网站的需求。
微软CEO Satya Nadella在作证时也承认,聊天机器人能够直接在AI平台向用户提供信息,从而减少用户访问原始新闻网站的需求。他把这种情形描述为聊天机器人通过直接提供信息,从新闻网站那里拿走了点击量。
OpenAI内部同样存在类似看法。ChatGPT负责人Nick Turley曾在内部确认,使用新闻内容训练商业AI产品,并让这些产品有能力取代新闻提供商,可能给出版商带来“生存性威胁”。他认为,当聊天机器人已经直接提供信息时,用户“没有充分理由”再点击原始链接,并在内部讨论中把聊天机器人描述为“基本上具有替代性”,且认为随着产品能力提升,这种替代关系还会进一步增强。
新闻机构方面还指控,微软和OpenAI内部人员早已意识到AI产品可能输出与训练数据高度相似的内容。原告方表示,他们进行了多种测试,尝试让相关AI产品直接复现新闻文章内容,结果发现出现大段内容复现。新闻机构据此认为,两家公司并未充分采取措施阻止这类输出,甚至采取了让新闻机构更难测试AI模型的措施。Brent Hecht的一份内部文件也提到,公司开发了一项过滤机制,可能让训练数据版权方“更难了解哪些内容被用于训练”。
对此,微软发言人回应称,微软的AI产品属于具有转换性质的合理使用,并不会取代新闻网站;同时表示Hecht的内部文件仅代表一名员工的个人观点,并非法律分析,也不能代表微软公司的立场。OpenAI截至报道发布时尚未回应相关置评请求。在生成式AI快速演进的背景下,训练数据来源、模型输出与原创内容保护之间的边界,正在成为整个行业必须面对的核心议题。
来源:Heooo AI工具导航