CIFQA框架提升金融问答数值准确性
「CIFQA是一种确定性工具支撑的多智能体LLM框架,专为计算密集型金融问答设计。它将语言理解与数值执行分离,在定期存款问答基准上取得95.54%的计算密集型准确率和90.87%总体准确率,显著优于直接使用大型语言模型,并证明架构设计比模型规模更关键。」
大型语言模型在自然语言任务中表现卓越,但在处理涉及结构化利率、时间条件、数值公式和规则约束的多步骤金融计算时,常常生成数值错误却看似合理的答案。这一缺陷严重限制了LLM在财务分析、投资决策等高风险场景中的应用。针对这一挑战,研究团队提出了CIFQA——一种确定性工具支撑的多智能体LLM框架,专门用于计算密集型金融问答。
CIFQA的核心设计思路是将语言理解与数值执行彻底分离。框架不再让单个模型同时承担语义解析和数学计算两大任务,而是组建了一个分工明确的智能体团队:查询解释智能体负责理解用户问题的真实意图,路由智能体判断问题类型和所需的计算路径,参数提取智能体从自然语言中抽取利率、期限、本金等结构化参数,计算规划智能体制定分步计算方案,最终由响应生成智能体将数值结果转化为自然语言答案。与此同时,所有金融计算和规则应用均由确定性的Python工具完成,确保每一步运算都可追溯、可验证。
为了评估CIFQA的实际效果,研究团队将框架实例化到定期存款问答场景,并构建了一个包含多种复杂查询的基准数据集。实验结果显示,CIFQA在计算密集型查询上达到95.54%的准确率,总体准确率为90.87%,大幅超越了直接使用LLM的基线模型——即便基线模型被提供了完整的公式、利率表和基准测试说明,其表现仍然远逊于CIFQA。这一结果有力证明了将计算外置于确定性工具的有效性。
消融研究进一步揭示了各确定性组件的贡献。精确利率查找、存期计算、滚动年度调整和提前支取逻辑这四个组件均对最终性能有显著影响。移除其中任何一个,框架的准确率都会明显下降。这说明金融计算中的领域规则不能依赖模型的隐式记忆,而必须显式编码为可执行逻辑。
尤为引人注目的是,一个参数量仅为170亿的开源模型在CIFQA框架内运行,其表现超过了使用相同金融信息的更大规模前沿模型。这意味着在计算密集型金融任务中,架构设计比模型规模更能决定数值可靠性。CIFQA通过合理的任务分解和工具集成,让中小型开源模型也能达到甚至超越闭源大模型的水平,为资源受限的金融机构提供了切实可行的技术路径。
尽管当前评估聚焦于定期存款查询,CIFQA的框架本身具有通用性。任何需要精确数值推理与规则约束的金融任务,例如贷款计算、债券估值、保险赔付核算等,都可以借鉴其智能体分工加确定性工具执行的模式。研究团队指出,未来的工作将把CIFQA扩展到更广泛的金融领域,并探索与更多专业计算引擎的集成。这一方向对于提升金融AI的可靠性和可信度具有重要价值。
来源:Heooo AI工具导航