GuideSkill框架提升临床推理准确率
「GuideSkill是一种将临床指南编译为可执行函数的外部推理层,通过初始化与进化机制,在四个基准和四个骨干模型上显著提升诊断准确率。相比指南RAG,GuideSkill-Zero平均提升13.45%,GuideSkill-Evo相对直接推理提升18.49%,且无需更新骨干参数,展示了可执行技能在临床推理中的巨大潜力。」
临床实践指南(CPGs)承载着疾病诊断的标准流程,然而大型语言模型(LLM)在应用这些指南时,往往只是检索相关文本或通过训练隐式吸收,而非真正执行指南中的规则。这种间接应用方式容易导致诊断推理与指南要求脱节,影响准确性和可靠性。针对这一痛点,研究人员提出了GuideSkill框架,旨在通过将指南编译为可执行的函数,为LLM提供一种外部推理层,从而更严格地遵循指南逻辑。
GuideSkill的核心创新在于将疾病特定的诊断标准转化为可执行的函数,这些函数能够返回序数诊断支持分数。这种设计使得模型不再仅仅依赖文本理解,而是能够直接运行规则,进行量化评估。GuideSkill包含两个版本:GuideSkill-Zero从指南直接初始化,而GuideSkill-Evo则利用病例-诊断配对数据进一步细化已有技能,并补充缺失的诊断条目,从而持续优化技能库。
在推理阶段,LLM首先提出一个鉴别诊断列表,然后GuideSkill会匹配相应的技能,提取所需特征,并将执行技能得到的分数与LLM的排序结果进行融合,最终生成更准确的诊断建议。这种融合机制兼顾了数据驱动与规则驱动,既利用了LLM的语义理解能力,又确保了规则执行的严谨性。
实验结果显示,GuideSkill在多个基准测试和多种骨干模型上均取得了显著提升。具体而言,GuideSkill-Zero在四个基准上的宏平均准确率比指南RAG平均提高了13.45%,证明了编译指南为可执行技能的有效性。而GuideSkill-Evo则进一步提升了性能,它在每个骨干模型上都取得了最高的宏平均准确率,相对直接推理提升了18.49%,并将金标准技能覆盖率从56.5%提升至99.5%,意味着几乎所有的诊断相关技能都能被覆盖到。
尤为值得关注的是,在Qwen3.5-9B模型上,GuideSkill-Evo甚至超越了最强的参数更新基线,提升幅度达11.16%,且无需对骨干模型进行任何参数更新。这一特性使得GuideSkill成为一种模型无关的通用机制,能够灵活应用于不同的LLM,而无需昂贵的微调过程。
专家评估进一步表明,GuideSkill生成的技能在临床上是合理的,且具有广泛的可接受性。这意味着由指南初始化和病例进化而来的规则不仅准确,而且具有实际应用价值。该研究为将指南推导的程序与病例推导的诊断模式相结合提供了一条新路径,展示了可执行技能在临床推理中的巨大潜力。
GuideSkill的提出,不仅解决了LLM在临床推理中应用指南的短板,还为其他领域提供了可借鉴的思路:将领域知识编译为可执行函数,与LLM的推理能力相结合,有望在更多需要严格规则遵循的场景中发挥作用。未来,随着技能库的不断丰富和进化机制的优化,GuideSkill有望成为临床决策支持系统的重要组件。
来源:Heooo AI工具导航