小模型配Agent工作流诊断准确率超前沿LLM
「一篇来自arXiv的新论文提出DeepLens Diagnosis Agent,通过五阶段Agentic工作流设计,让仅7B参数的小型医疗推理模型在诊断任务上超越Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大模型。在915例的DiagnosisArena基准测试中,该Agent取得60.14%的Top-1准确率,比无工作流的同一模型提升36个百分点,且单例成本仅0.0072美元,比前沿模型低35%至45%。工作流产生的结构化中间产物支持审计与错误定位,为高可靠性医疗AI提供了新范式。」
在医疗诊断这一高风险的推理场景中,大型语言模型(LLM)常因单次提示(single-shot prompting)而产生脆弱的诊断逻辑。近日,一篇来自arXiv的论文提出了DeepLens Diagnosis Agent,通过精巧的Agentic工作流设计,让一个仅有7B参数的小型医疗推理模型在诊断准确率上超越Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大模型,同时大幅降低了推理成本。
该研究由JSL团队主导,核心思路是将医疗诊断拆解为五个结构化阶段:结构化临床事实提取、基于检索增强生成(RAG)的约束性知识检索、受限候选诊断生成、显式证据三角验证,以及可审计的最终决策。整个管线以JSL Medical Small 7B v2模型为推理引擎,通过工作流约束弥补模型参数规模的不足。
在包含915个复杂病例的DiagnosisArena基准测试中,DeepLens Diagnosis Agent实现了60.14%的Top-1诊断准确率,在所有中小型模型中位列第一。作为对比,同一模型在不使用Agent工作流时,准确率仅为23.99%——工作流设计单独带来了超过36个百分点的提升。值得注意的是,该模型在标准医疗知识基准测试中得分高达88.2%,这说明诊断推理在不确定性条件下的表现,远非单纯的知识回忆所能覆盖。
成本与效率方面,该Agent每例诊断仅需0.0072美元(在A100 GPU上处理约2.4万Token),延迟为24秒。相比之下,Claude Sonnet 4.5每例成本为0.0110美元,Gemini 3.1 Pro为0.0128美元——DeepLens不仅成本低35%至45%,而且在准确率上分别高出9.70和9.17个百分点。论文指出,精心设计的工作流约束可以部分弥补模型在参数规模和API成本上的劣势,甚至能够纠正前沿模型在某些案例中的错误。
除了整体准确率,该管线还产生结构化的中间产物,使得每个推理阶段都可被审查、可复现。例如,事实提取阶段会输出结构化的患者病史摘要,检索阶段会列出引用的医学文献,候选生成阶段会展示鉴别诊断的推理链。这种设计支持在诊断错误发生时精确定位问题环节——是事实提取遗漏了关键症状,还是检索到的知识不相关,或是证据三角验证环节权重分配有误。对于医疗等高风险场景,这种可追溯性(traceability)和可审计性(auditability)与基准性能同样重要。
从更广阔的视角看,DeepLens Diagnosis Agent的成果印证了Agentic工作流在专业领域推理中的潜力。当模型规模受限于成本或部署条件时,通过将复杂任务分解为多个可控子任务,并引入外部知识库和结构化约束,小模型同样能够达到甚至超越大模型的水平。这一范式不仅适用于医疗诊断,也可推广到法律分析、金融风险评估、科学文献综述等需要多步推理与证据整合的领域。
该研究的代码和模型权重已在Hugging Face等平台开放,为社区提供了可复现的基准。未来工作可能包括引入多模态数据(如医学影像)作为额外事实源,以及探索动态工作流——根据病例复杂度自动调整推理步骤。在AI医疗落地过程中,DeepLens Agent提供了一条平衡性能、成本与可靠性的务实路径。
来源:Heooo AI工具导航