可解释多模态分类的线性判别树集成框架
「多模态情感与行为分类需兼顾准确性与可解释性,现有Transformer模型难以解释特征权重。新研究提出基于线性判别树集成的框架,通过概念聚类和修正特征重要性指标,在IEMOCAP和CMU-MOSI上比多模态Transformer提升F1 4.3%,准确率超过可解释基线3.0%,且人工标注一致性大幅提高。」
多模态情感与行为分类是人工智能领域的重要研究方向,其目标是对文本、音频和视觉等异构信息流进行联合建模,以识别人类情感状态或行为模式。在实际应用中,这类系统不仅需要达到较高的预测精度,还要求能够以人类可理解的方式解释其决策依据。然而,当前主流的高容量模型,尤其是Transformer架构,虽然展现出强大的性能,却因其分布式表示和深层非线性结构,难以对单个多模态特征赋予具有实际意义的权重,这限制了它们在临床情感监测、教育评估等对信任度要求较高的场景中的应用。
针对这一矛盾,一项发表于arXiv的新研究提出了一种基于树集成方法的框架,旨在同时实现多模态分类的准确性与可解释性。该框架的设计思路清晰:首先将每种模态编码为令牌序列,随后从中提取并聚类概念以降低数据维度,接着将融合后的模态信息送入树集成分类器进行判别,最后利用一种改进的特征重要性指标对分类趋势进行解释。这一流程有效规避了深度模型的黑箱问题,同时保持了较强的表达能力。
研究团队在该框架下实现了三种分类器:线性判别树、线性判别森林以及线性判别AdaBoost。实验结果表明,这些模型在多模态情感分类任务中取得了显著优于现有方法的性能。具体而言,所提方法在F1分数上相比多模态Transformer取得了4.3%的提升,在准确率上比主流的可解释多模态基准方法——可解释多模态路由模型——高出3.0%。这一结果说明,树集成方法在保持可解释性的同时,并非以牺牲精度为代价,反而能够超越部分高容量深度学习模型。
在可解释性方面,研究提出了一种修正的特征重要性指标,用于在多模态特征中提取关键的跨模态概念。该指标的特殊之处在于,它减少了二分类任务中负类样本的影响,从而更有效地捕捉指示性标记或特征。实验显示,使用这种修正的指标后,模型对关键概念的提取与人工标注的一致性显著提升:在IEMOCAP数据集上,人工标注一致性从默认特征重要性的43.2%提高到62.2%;在CMU-MOSI数据集上,从32.1%提高到46.7%。这表明新方法提供的解释更符合人类对情感线索的认知,增强了模型的实用性和可信度。
这项工作的意义不仅在于提出了一种性能更优的分类器,更在于为多模态可解释人工智能提供了新思路。通过将概念提取、维度约简和树集成判别有机结合,研究团队构建了一个兼具精度与透明度的完整解决方案。未来,这类方法有望在临床心理状态评估、在线教育反馈、人机交互等需要充分解释性的领域发挥重要作用,推动人工智能从“能用”向“可信”迈进。
来源:Heooo AI工具导航