小模型文档搜索超越GPT-5.6Sol
「Neon与Castform联手用强化学习后训练出4B参数开源模型,在文档搜索任务中准确率超过GPT-5.6Sol,单次推理成本仅为后者的约百分之一。该模型通过智能体式搜索范式,将大问题拆解为多轮检索,以极低开销实现高精度,为AI智能体应用带来成本结构变革。」
Neon和Castform两家公司近日联合发布了他们在文档搜索领域的最新成果——一个仅有4B参数的开源模型。经过强化学习后训练,这个小模型在文档搜索任务上的准确率不仅不逊色于GPT-5.6Sol,甚至实现了超越。更令人瞩目的是,其单次推理成本仅为GPT-5.6Sol的约百分之一,这为依赖大规模检索的AI智能体应用打开了新的可能性。
这一突破背后,是两家公司对搜索范式的重新思考。目前文档检索的主流方式仍是嵌入式搜索,即将文档转化为数值向量,再通过相似度匹配来寻找相关内容。然而,随着AI智能体的普及,搜索流程正在向智能体式搜索转变:模型将复杂的大问题拆解成多个小问题,自主决定搜索查询,检视结果,再发起下一轮搜索,如此循环往复,直到收集齐所有所需信息。这种范式能够处理更复杂的任务,但其代价是每一次搜索都需要调用高性能模型,带来的耗时和成本都相当可观。按照Neon给出的典型请求口径,GPT-5.6Sol完成一次搜索请求需要超过10秒,成本约为0.03美元。
在这一合作中,Neon与Castform分工明确:Neon提供文档存储位置和搜索能力,Castform则负责训练模型判断“该搜什么”。训练过程采用强化学习,模型先尝试完成任务,系统根据结果打分,评分直接反馈到下一轮试验中。评估维度不仅关注最终答案的对错,还会考察是否找到了正确的文档、是否引用了合适的段落。经过Castform后训练的模型,在Neon的验证中获得了平均评估分1.447,高于GPT-5.6Sol的1.369,也高于作为对照的GPT-5.4的1.377,刷新了该验证集的最高纪录。
成本优势才是真正的杀手锏。这个4B小模型的单次推理成本为0.000929美元,而GPT-5.6Sol高达0.087338美元,两者相差约94倍。用4B参数吞下GPT-5.6Sol级别的搜索精度,同时将推理开销压缩到几乎可以忽略不计,这对于高度依赖反复调用模型进行多轮检索的智能体应用来说,意味着单位成本结构被彻底改写。以往因成本顾虑而不敢采用的复杂搜索策略,如今在小模型的高效支撑下变得切实可行。这项成果不仅展示了强化学习在小模型潜力挖掘上的巨大价值,也为AI搜索领域提供了一条更经济、更高效的演进路线。
来源:Heooo AI工具导航