技术进展

前沿大模型在肿瘤决策中存在集体能力边界

Heooo 09月01日12时04分 2 阅读

「最新研究构建肿瘤决策边界基准(ODBB),评估九款前沿大模型在2,005个肿瘤决策点上的表现,发现42.1%的决策点无一模型答对,失败集中在指南路径选择等临床元判断环节,表明仅靠增加训练数据难以突破瓶颈,需架构干预。」

大型语言模型在医学知识考试中屡获高分,但真实世界的肿瘤诊疗并非一场知识测试,而是一连串基于指南的路径选择、升级判断以及不确定性下的决策承诺。现有基准大多衡量事实回忆能力,却未回答一个关键问题:前沿大模型之间是否存在共同的决策盲区,以至于即使将多个模型组合起来也无法弥补?一项发表于arXiv的最新研究对此进行了系统探讨。

研究团队构建了肿瘤决策边界基准(Oncology Decision Boundary Benchmark,简称ODBB),包含2,005个肿瘤决策点,覆盖NCCN指南相关条目与结直肠癌病例。他们评估了九款发布于2025年6月至2026年4月之间的前沿大模型,涵盖四个闭源模型家族与五个开源权重模型家族。为确保评分的可靠性,研究采用了一个完全确定性的评分器(零大模型推理调用),将输出分类为14种失败类型,并由两名肿瘤科医生独立验证了225项分层样本,Cohen加权 kappa 值分别为0.939和0.790,表明评分标准具有高度一致性。

最引人注目的发现是集体能力边界的存在。当把这九款模型视为一个汇总的超级模型时,全部2,005项决策中,有42.1%(Wilson 95%置信区间40.0%至44.3%)的条目没有一款模型能够正确回答。其中,NCCN指南相关的1,586项决策中有35.7%无法被任何模型解决,而419例结直肠癌病例中,这一比例飙升至66.4%。这意味着,即使集成所有九个模型,也有近三分之二的复杂临床病例无法得到正确决策。

研究进一步分析了失败模式,发现错误并非均匀分布,而是高度集中在“选择指南路径”这一环节——即在进入具体推理之前,模型就需要在多个指南路径之间做出正确选择。这是一种临床元判断能力,涉及对整体策略的把握。研究指出,这种集体盲区可能本质上需要架构层面的干预,而非投入更多训练数据就能解决。数据的堆叠无法弥补决策层面的系统性缺陷。

另一个值得警惕的现象涉及模型对决策果断性的调校差异。两款被专门训练为“果断”的模型——GPT-5.5与Gemini 3.1 Pro Preview——做出不安全的临床承诺的频率是其余七款“谨慎型”模型的三到五倍,但其整体正确率并未因此更高。这一发现对临床应用具有直接警示意义:追求决策速度或自信表现,可能以牺牲安全为代价。

此外,研究还观察到一种“知行分离”现象:在3%至9%的决策项中,模型能够陈述正确的下一步临床步骤,却未能实际做出相应的承诺。这种失败并非知识缺失,而是决策执行层面的断裂。模型“知道该做什么”,但无法将其转化为明确的行动指令。

这些结果共同指向一个结论:模型质量本身已不再是临床大模型部署的首要瓶颈。真正的约束在于,我们是否仍然假设某个单一模型能够独立承担临床决策的全部依据。研究团队认为,未来的进展需要架构层面的创新——例如,设计能够检测自身能力边界的系统,当模型判断其输出超出可信任范围时,主动将决策路由给人类临床医生。这种“自知之明”和“谦逊路由”机制,可能比进一步提高模型的知识准确率更能决定临床AI的实际价值。

该研究为AI在医疗决策领域的应用划出了一条清晰的能力边界:目前的前沿大模型虽然具备大量医学知识,但在面对真实世界的肿瘤治疗路径选择时,仍存在集体性的盲区。这也提醒开发者与临床机构,在部署AI辅助决策系统时,必须保留人类医生的最终判断权,并设计相应的人机协作机制,而非将模型作为独立的决策主体。

# 大模型 # 肿瘤决策 # 能力边界 # 医学AI # ODBB

来源:Heooo AI工具导航