技术进展

ClinLens基准测试揭示临床数据分析智能体短板

Heooo 07月31日12时02分 20 阅读

「新发布的ClinLens基准测试包含200个可执行任务,覆盖电子健康记录、心电图、胸片等五种多模态临床数据。测试显示,最强模型配置的严格通过率仅56.3%,而适配的通用编码智能体可解决83个任务,凸显了可运行代码与正确临床分析之间的巨大差距。」

临床数据科学智能体需要将异构的纵向记录转化为可审计的分析结果,然而现有基准测试大多局限于医学问答、结构化表格推理或通用科学数据仓库。为了填补这一空白,研究人员推出了ClinLens基准测试,旨在评估智能体在真实临床场景中的长期任务执行能力。

ClinLens包含200个可执行任务,基于五个相互关联的MIMIC数据资源,涵盖结构化电子健康记录、临床笔记、心电图、胸部X光片和超声心动图。这些任务通过一个4×5的分类体系进行组织,将四种患者时间范围与五种分析能力交叉组合,从而全面覆盖临床数据科学中的关键维度。

该基准测试采用程序优先的逆向合成方法,为每个受限的半原始数据包配备了一个评估者私有的参考工作流。系统需要检查所需的工件、队列和时间语义以及最终答案,确保评估的严谨性和可复现性。在固定的126个任务子集上,最强的模型脚手架配置达到了56.3%的范围内宏平均严格通过率,尽管执行成功率高达100%。这一数据表明,虽然模型能够生成可运行的代码,但在临床分析的准确性上仍有显著提升空间。

为了提供对比参考,研究人员还单独配置了一个编码智能体,该智能体成功解决了126个任务中的83个。然而,五个经过适配的生物医学系统在GPT-4o-mini上的严格通过率最高仅为2.9%。这一巨大差距揭示了当前临床数据分析智能体的一个重要问题:它们往往能够生成看似合理的代码,但无法正确完成临床分析任务。

ClinLens的发布为临床数据科学智能体的评估提供了新的标准。它不仅测试了模型处理多模态数据的能力,还强调了长期任务执行中的时间语义和审计要求。研究团队希望通过这一基准,推动开发出更可靠、更准确的临床数据分析工具,从而真正辅助医疗决策。

该基准测试的代码和数据已公开,供研究社区使用。未来,研究人员计划扩展任务类型,并引入更多临床场景,以进一步提升基准的覆盖面和挑战性。

# ClinLens # 临床数据 # 基准测试

来源:Heooo AI工具导航