注意力图拓扑特征助力大模型幻觉检测
「该研究通过分析注意力图的信息流动拓扑结构来区分大模型幻觉与非幻觉回答,利用Forman-Ricci曲率识别信息瓶颈,并捕捉注意力头的半局部与全局信息流特征。实验表明,这种单次推理方法在两个幻觉检测基准上稳定超越现有基线,且上下文共享受损与幻觉强相关。」
大语言模型的幻觉问题一直是制约其可靠落地的关键障碍,而如何在不依赖外部知识库或多次采样的前提下,仅凭模型内部信号识别幻觉,是当前研究的热点方向。一篇新发表于arXiv的论文提出了一条颇具新意的思路:把注意力图看作一张信息流动的网络,从拓扑结构上寻找幻觉的“指纹”。
研究者的出发点是,模型在生成回答时,token之间的信息并非均匀流动。当上下文共享机制正常工作时,后续token能够有效地从前面相关内容中检索信息;而当这种共享受损时,模型就可能转而依赖自身的参数记忆去生成内容,从而产生幻觉。为了刻画这种流动模式,研究团队引入了Forman-Ricci曲率这一来自离散几何的工具,用来度量注意力图中的结构特征,并据此定位信息瓶颈。
在此基础之上,论文提出了一套能够同时捕捉半局部与全局信息流特征的方法,用于刻画与幻觉回答相关联的注意力头。与需要多次采样、多轮生成再做比对的多响应基线不同,该方法只需一次前向推理即可给出判断,因而在效率上具有天然优势。研究者强调,这种单次通过的方式在实际部署中更易落地,不需要为同一个问题反复调用模型。
实验部分覆盖了多个主流大语言模型与既有基准。结果显示,该方法在两个幻觉检测基准上均取得了稳定的性能提升,优于现有的基于注意力信号的方案以及多响应对比方案;同时,在不同模型架构之间也保持了有竞争力的表现,说明其所依赖的拓扑信号并非绑定于某一种特定的网络结构。
更值得关注的是论文对现象本身的解释。分析表明,因果生成过程中token之间上下文共享的受损,与幻觉的发生存在强关联。幻觉回答通常呈现出三种一致的特征:过度依赖自注意力、从更早token处检索到的上下文过于发散、以及信息的过度压缩,也就是所谓的over-squashing。研究者特别指出,这些特征在Transformer的最后一层尤为明显,暗示最终层的信息聚合方式可能是幻觉生成的关键环节。
这一发现的意义不止于检测。如果幻觉确实对应着可被曲率刻画的拓扑异常,那么未来或许可以通过干预注意力模式、缓解信息过度压缩来抑制幻觉,而不仅仅是在输出之后做事后判别。对于可解释性研究来说,把注意力头看作信息流动网络中的节点与边,也为理解大模型内部计算提供了一种新的观察尺度。
当然,从论文到工程落地仍有距离。单次推理的检测器需要在更多任务类型、更长上下文以及不同解码策略下验证其稳健性,曲率计算带来的额外开销也需要评估。但无论如何,这项工作提示了一个值得深入的方向:幻觉也许并非模型知识不足那么简单,而更像是信息在层与层之间传递时发生的结构性堵塞。
来源:Heooo AI工具导航