CARAT评测揭示材料大模型是推理还是复述
「一项发表于arXiv的研究提出CARAT评测框架,用于区分材料科学领域的大语言模型是在真正推理晶体结构,还是仅复述训练数据中的答案。研究发现,在缺乏关键信息时模型性能大幅下降,表明其依赖记忆而非结构化推理。」
在材料科学与人工智能交叉领域,大语言模型(LLM)正被广泛用于预测和解释晶体结构等复杂属性。然而,一个根本性问题长期悬而未决:当这些模型给出看似准确的回答时,它们究竟是在基于结构进行逻辑推理,还是仅仅复述训练数据中已有的答案?为解答这一问题,研究人员提出了名为CARAT(Crystal-Aware Reasoning Assessment Toolkit)的新型评测框架,并在arXiv上发表了题为《CARAT: Do Materials LLMs Reason or Recite?》的论文。
CARAT的核心创新在于其设计了八种“匹配视图”(matched views),在保持问题和标准答案不变的前提下,系统性地改变输入信息的呈现方式。例如,某些视图提供完整的晶体结构描述,而另一些则故意省略关键字段。通过这种方式,研究者能够分离出模型对结构信息的真实依赖程度,而非仅依赖表面文本匹配。
实验结果显示,在最具挑战性的材料家族上,使用“接地视图”(grounded view)——即包含明确结构关系的输入——相比仅提供化学式的输入,性能提升高达17.3个百分点。更深入的分析表明,当基础图表示(plain periodic graph)缺失必要信息时,CARAT提出的GraphSpace表示方法可带来高达46.7分的增益;而在信息完整的情况下,增益仅为1.96分。这说明以往的性能差距主要源于基线模型的信息缺失,而非推理机制本身的优劣。
为验证模型是否真正利用结构关系进行推理,研究团队还设计了一项“快捷路径攻击”测试:通过绕过结构链接直接读取答案列表,发现原始模型在七类困难材料中有四类可被此类捷径破解。为此,他们重构了基准,最终使十一种潜在捷径的准确率降至接近随机水平。随后的配对推理实验揭示了一个关键现象:即使将结构链接重定向至无关内容,冻结参数的模型仍能在95.6%的情况下给出相同答案——表明它只是机械复述关系标签,而非真正使用该关系进行推理。
值得注意的是,在引入匹配监督微调后,模型在正确使用结构链接时的准确率跃升至99.8%;而一旦删除该链接,性能骤降至23.4%,甚至低于最佳捷径所能达到的27.0%。这一结果有力证明,模型的行为是可学习的:它既能学会依赖真实证据,也能退化为记忆复述,取决于训练信号的设计。
CARAT不仅为材料AI模型提供了更严格的评估标准,也为整个科学大模型领域树立了新的方法论范式——强调区分“记忆”与“推理”的必要性。未来,此类评测工具有望推动模型从表面拟合走向真正的科学理解。
来源:Heooo AI工具导航