科研文献或成LLM训练毒药 封面图
技术进展

科研文献或成LLM训练毒药

Heooo 07月29日23时58分 29 阅读

「最新研究指出,21世纪科学文献对大型语言模型(LLM)的训练可能产生负面效果。来自MIT、康奈尔、卡内基梅隆、谷歌和OpenAI的联合团队发现,从训练数据中移除ArXiv、PhilPapers和NIH ExPorter等学术语料后,LLM在学术问答和综合基准上的表现反而提升,同时毒性输出减少。文章分析了科学文献中普遍存在的夸大、虚假数据和理论拼凑现象,认为这类文本本质上是“半真半假”的雷区。此外,科学家依赖的社交信誉网络无法被AI代理复制,这给“AI for Science”带来了根本性挑战。」

在人工智能领域,训练数据的质量直接决定了模型的性能上限。然而,一项来自顶级科研机构的最新研究却揭示了一个令人不安的事实:被视为知识殿堂的科学文献,可能正在“毒害”大型语言模型(LLM)。

来自MIT、康奈尔大学、卡内基梅隆大学、谷歌和OpenAI的联合研究团队,通过控制变量实验发现,当从LLM的训练语料中移除ArXiv、PhilPapers和NIH ExPorter等学术论文数据库后,模型在学术问答任务上的得分反而更高,综合基准测试表现也优于保留这些文献的版本。更值得注意的是,移除这些文献后,模型生成有害内容的概率显著下降。

这一发现颠覆了“高质量学术文本必然有益于模型训练”的传统认知。研究团队指出,21世纪的科学文献本质上是一个“半真半假的雷区”。在“诚实vs不诚实”与“正确vs错误”构成的四象限矩阵中,大量论文同时散布在多个区域,甚至同一篇论文的不同部分可能分属不同象限。更糟糕的是,许多论文会刻意伪装——比如一位诚实的科学家为了发表成果,不得不将真实的实验包装在充满夸饰的辞藻中,并用错误却流行的理论来解释数据,以便与隔壁造假者编造的完美数据竞争。这种环境导致训练语料中充斥着“方便的省略”和“彻头彻尾的谎言”,与真正的事实和发现难以区分。

科研文献或成LLM训练毒药

尽管该研究并非完全一致——移除PubMed语料反而略微降低了模型性能——但整体趋势已经足够说明问题:大规模清除科学文献能提升LLM表现,这一现象在2024年的实验中已经得到验证。研究者推测,即便到2026年,这一结论依然可能成立。

除了论文正文本身,科学元数据同样无法提供帮助。一旦作者身份和引用次数被用作评价指标,所有信号都被人为操纵。高知名度机构、知名研究者乃至任何学科领域,都无法免于学术不端的侵袭。这意味着,依赖文献元数据来筛选训练语料的做法,在根本上就是不可靠的。

这一发现对“AI for Science”领域具有深远的实践意义。人类科学家在判断研究可靠性时,依赖的是非正式社交网络——通过同行交流、实验室互访、重复实验等方式,建立起对“哪些工作是可靠的、哪些研究真正重要”的个性化认知。而AI代理无法参与这种社交关系,除非通过人类中介,否则无法获取这些社交元数据。

这给AI for Science留下了几个艰难的选择:要么创建能与人类科学家进行社交的AI代理,要么频繁记录人类科学家在私密环境中的讨论,要么为科学家提供持续性的“学术八卦”流。无论哪种方案,都面临着隐私、伦理和可扩展性的巨大挑战。

该研究提醒我们:在追求更强大的AI时,训练数据的“毒性”检测或许比数量堆积更为重要。科学文献并非天然纯净,其内在的夸大、扭曲和错误,正在通过训练语料潜移默化地影响LLM的思维模式。未来,如何构建更健康的训练数据筛选机制,将成为AI技术发展中的关键课题。

# LLM训练 # 科学文献 # 数据毒性 # AI for Science # 学术语料

来源:Heooo AI工具导航