多模态模型抽象感知推理新基准揭示巨大短板
「一项新研究推出“未成文基准”,通过听笔划声和看手部动作推断书写中的单词,测试多模态模型的抽象感知推理能力。结果显示人类准确率超80%,而GPT-4o、Gemini 2.5-Pro等顶尖模型不足10%,且多模态融合反而降低性能,暴露模型跨模态因果推理的根本缺陷。」
多模态大模型在静态图像识别、语音转写等任务上已经达到了相当高的水平,然而当面对需要从动态生成过程中推断未见信息的抽象感知推理时,它们还能保持同样出色的表现吗?一项来自arXiv的最新研究给出了令人警醒的答案:即便像GPT-4o和Gemini 2.5-Pro这样的行业顶尖模型,也在一个专门设计的新基准测试中遭遇了近乎“全军覆没”的失败。
这项研究提出了一个名为“未成文基准”(The Unwritten Benchmark)的全新挑战,其核心任务被定义为“声动运动学单词推断”(acousto-kinematic word inference)。具体来说,研究人员让书写者在三种不同的书写风格下,在看不见任何墨迹的表面上书写单词,同时录制下笔尖划过的音频和手部运动的视频。模型需要仅凭这些笔划声音和手部运动视频,来解读出正在被书写的单词是什么。这意味着模型无法依赖任何可见的文字痕迹,只能通过感知声音与运动之间的微妙关联,来构建对书写内容的理解。
这一任务对人类来说并不算特别困难。实验数据显示,人类参与者在有序字母准确率上可以轻松达到80%以上,展现出强大的跨模态感知和抽象推理能力。然而,当前最先进的多模态机器学习模型的表现却令人大跌眼镜——包括GPT-4o、Gemini 2.5-Pro在内的多个领先模型,在相同任务上的准确率甚至未能突破10%。这一巨大的性能鸿沟,凸显了当前人工智能与人类认知之间依然存在难以逾越的差距。
更值得关注的是,研究团队还发现了一种令人困惑的“融合悖论”现象。在单模态条件下,一些模型尚能捕捉到部分线索,但当同时提供音频和视频两种模态信息时,模型的性能不但没有提升,反而出现了明显的下降。这种“多模态反而更差”的结果,说明模型未能有效整合和利用互补的感知线索,甚至在信息融合过程中产生了干扰。这种根本性的协调失败,指向了当前多模态架构在跨模态因果推理上的深层缺陷。
研究人员指出,这项任务之所以困难,在于它要求模型不仅要识别静态的特征,更要理解动态过程的微小运动学细节。笔划的节奏、压力的变化、手部运动的轨迹,这些微妙的物理线索在人类看来是自然而然的感知整合,但在模型中却难以被有效建模。论文认为,这种对微观运动学的理解以及对因果关系的跨模态推理,是直觉性感知认知的关键组成部分,而现有模型在这方面的能力几乎可以忽略不计。
这项研究的价值不仅在于揭示了一个新的评测维度,更在于为多模态学习的未来研究提供了重要的方向性提示。当前主流的多模态模型大多建立在静态图像和文本的对齐之上,而真实世界的感知往往是动态、连续且多感官交织的。如何让模型学会从冗余甚至冲突的多模态信号中提取一致的信息,如何建立对生成过程的因果理解,都是未来需要攻克的难题。未成文基准作为一个开放挑战,为研究者提供了一个检验模型抽象推理能力的“试金石”,也为推动多模态人工智能向更接近人类认知水平迈进提供了新的思考路径。
来源:Heooo AI工具导航