Pistis多模态大模型技术报告发布
「arXiv发布Pistis技术报告,推出基于Qwen3.6与Qwen3.5构建的27B和9B参数多模态大模型家族。该框架以大规模多模态监督微调为基础,提出交替式蒸馏与强化学习新范式IDRL,并衍生出Pistis-Thinking与Pistis-Agentic两个专用变体,同时引入PAH系统级方法自动优化推理框架。」
arXiv平台近日发布了一份名为Pistis Technical Report的技术报告,系统介绍了一个全新的多模态大语言模型家族Pistis。该模型家族包含27B与9B两种参数规模,分别构建于Qwen3.6和Qwen3.5基础之上,并通过一套通用且可扩展的后训练框架完成开发。这一工作从基础模型选择、训练范式设计到系统级推理优化,构成了一条相对完整的模型能力提升链路。
在训练流程上,Pistis框架首先通过大规模多模态监督微调(SFT)建立稳固的能力基础。研究团队指出,这一阶段的目标是为后续更复杂的优化过程提供高质量起点。在此基础上,报告提出了一种名为Interleaved Distillation and Reinforcement Learning(IDRL)的新型后训练范式。IDRL的核心思路是将在线策略蒸馏与强化学习紧密整合进同一个训练循环,通过在两种目标之间交替优化,而非单独优化其中一项,也不是将它们静态组合为一个联合损失函数。
研究团队表示,这种交替式设计带来了多方面的收益:知识迁移更为有效,优化过程更加稳定,并且在长时程智能体轨迹中能够实现更精确的信用分配。这些特性有助于模型在提升综合表现的同时,缓解常见的多模态能力此消彼长问题,也就是某一项能力增强往往以另一项能力下降为代价的权衡困境。
在两种参数规模上,该框架都产出了两个专用变体。其中Pistis-Thinking专注于强化深度多模态推理能力,面向需要多层逻辑推进的复杂任务;Pistis-Agentic则额外引入智能体轨迹数据,用于支持长时程规划、迭代式推理以及工具调用。报告特别提到,Pistis-Agentic在多模态搜索场景中表现尤为突出。两个规模下的变体均优于各自对应的基础模型,说明该后训练框架在不同参数量级上都具备可迁移的增益效果。
除了模型参数层面的优化,报告还提出了Pistis-Auto-Harnessing(PAH),这是一种系统级方法,通过迭代优化自动改进智能体的推理框架(harness)。实验显示,PAH能够在不更新模型参数、也不增加交互预算的前提下提升模型性能。这一结果的意义在于,它把能力提升的来源从传统的权重更新扩展到了推理时框架的自动调优,为智能体系统优化提供了另一条不依赖算力扩张的路径。
整体来看,Pistis技术报告所呈现的工作覆盖了从监督微调、蒸馏与强化学习融合,到专用变体分化,再到推理框架自动优化的多个层面。IDRL所强调的交替式训练思想,以及PAH所代表的系统级优化思路,均为多模态大模型与智能体系统的后训练研究提供了可参考的技术方案。
来源:Heooo AI工具导航