随机采样揭示LLM认知深度局限
「一项最新研究通过随机矩阵理论分析发现,大型语言模型在重复运行时通过温度参数(τ=1)产生的输出变化,虽然能通过自一致性方法提供单问题的不确定性估计,但其跨问题结构维度极低,最多仅有一个信号维度高于噪声。相比之下,由24个不同模型组成的集成在相同问题上展现出四个显著特征值,揭示了模型未知知识的丰富结构。该研究在MMLU、HellaSwag和GSM8K三个基准测试上验证了这一结论,表明随机采样在认知深度上存在根本性局限,无法替代多样化的模型集成。」
大型语言模型在重复回答同一问题时,有时会给出不同答案。这种随机性是否反映了模型真正的知识边界?一项来自arXiv的最新研究给出了否定答案:随机采样在认知层面是浅薄的,其产生的变化维度远低于由不同模型组成的集成。
该研究题为“随机采样在认知上是浅薄的:LLM中温度变化与模型多样性之间的维度差距”,通过严格的随机矩阵理论分析,揭示了单一模型通过温度参数(τ=1)生成的多次输出,其跨问题结构维度极低。具体而言,在五个不同模型家族和三个基准测试(MMLU、HellaSwag、GSM8K)上,单一模型重复运行产生的信号维度最多只有一个高于噪声水平。这意味着,虽然自一致性方法(即对多次运行结果进行多数投票)能够提供有效的单问题不确定性估计,但它无法揭示不同问题之间共同变化的深层结构。
研究团队将单一模型100次运行(τ=1)的结果,与一个由24个不同LLM组成的集成(每个模型运行一次,τ=0)进行了对比。通过Marchenko-Pastur随机矩阵检验,他们发现集成模型在相同问题上展现出四个显著高于噪声的特征值,而单一模型最多只有一个。为了确保这一差异并非偶然,研究者还构建了一个匹配难度的伯努利零模型,在500次蒙特卡洛模拟中,该零模型最多只产生一个高于噪声的特征值。这一结果强有力地证明了集成模型能够捕获更丰富的跨问题结构信息。
这一发现对当前LLM不确定性估计和可靠性研究具有重要启示。目前,自一致性方法被广泛用于提高模型回答的准确性和提供不确定性指标,但该研究指出,这种方法本质上只能反映模型内部的随机波动,而无法触及模型知识结构的深层维度。相比之下,多样化的模型集成能够揭示模型“不知道什么”的复杂模式,为开发者提供更全面的认知地图。
研究团队强调,这一维度差距并非技术细节,而是反映了随机采样与模型多样性在认知功能上的根本差异。单一模型通过温度参数产生的随机性,本质上只是对同一知识空间内的局部扰动,而不同模型由于训练数据、架构和优化目标的差异,形成了真正多样化的知识表征。因此,在需要深度不确定性分析的应用场景中,依赖单一模型的多次采样可能远远不够,而应优先考虑构建和利用多样化的模型集成。
这项工作为LLM的可靠性评估提供了新的理论视角,也提醒业界在追求模型性能的同时,不应忽视认知多样性的价值。未来,如何高效构建和利用模型集成,可能成为提升AI系统可信度的关键方向之一。
来源:Heooo AI工具导航