中文医疗大模型评测基准MedBench 5.0发布
「上海人工智能实验室联合多家顶尖机构发布MedBench 5.0,该版本首创医疗原子技能评测范式,构建专科化评测体系,实现对AI模型幻觉的全维度校正,筑牢医疗AI安全防线。作为国内首个原生医疗垂直评测体系,MedBench已成为医疗大模型规范化发展的重要支撑。」
医疗人工智能正朝着更专科化与更安全的方向加速迈进。近日,中文医疗大模型评测基准MedBench正式迎来5.0版本的全面升级,这一重要进展由上海人工智能实验室科研团队联合广州实验室、广州医科大学附属第一医院钟南山院士团队以及复旦大学附属中山医院葛均波院士团队共同完成。
此次升级的核心亮点在于专科化评测体系的构建。MedBench 5.0不再采用通用型评测框架,而是针对不同医学专科领域设计了差异化的评测指标和任务场景,使得医疗大模型的能力评估更加精准和贴近临床实际。这一转变标志着医疗AI评测从“大而全”向“专而精”的范式演进。
尤为值得关注的是,新版本首创了医疗原子技能评测范式。所谓“原子技能”,指的是将复杂的医疗任务拆解为不可再分的最小技能单元,例如病史采集、诊断推理、用药建议等。通过对这些基础技能的独立评测,能够更细致地定位模型在特定环节的薄弱点,进而实现对其幻觉现象的全维度校正。这一创新方法显著提升了大模型在医疗场景中的可靠性和安全性。
作为国内首个原生医疗垂直评测体系,MedBench自推出以来便承担着推动医疗大模型规范化、高质量发展的重要使命。此次5.0版本的发布,不仅强化了其在技术评测领域的权威性,还进一步巩固了其作为上海市委网信办和上海市卫健委指定的前置医疗AI应用技术评测载体的地位。这意味着,任何计划在上海地区落地应用的医疗AI产品,都需要通过MedBench的严格评测,从而在源头上保障患者安全和医疗质量。
业内专家指出,MedBench 5.0的发布恰逢医疗AI快速渗透临床的关键时期。随着大模型在辅助诊断、健康管理、药物研发等领域的应用日益广泛,如何确保其输出的准确性和安全性成为行业焦点。MedBench通过汇聚顶尖科研力量,构建了覆盖多专科、多技能的评测体系,为医疗AI的合规应用提供了科学依据。
未来,MedBench有望进一步扩展评测维度,纳入更多真实世界数据和临床反馈,持续迭代升级。同时,其首创的原子技能评测范式也有望推广至其他垂直领域,成为AI安全评测的重要参考。在多方协作下,中文医疗大模型的安全防线将更加牢固,为智慧医疗的健康发展保驾护航。
来源:Heooo AI工具导航