Pistis多模态大模型详解:IDRL交替蒸馏与强化学习新范式

Pistis通过IDRL交替蒸馏与强化学习,结合PAH系统优化,构建出覆盖深度推理与长程智能体的多模态模型家族。
Pistis是基于Qwen系列构建的多模态大语言模型家族,提供27B和9B两种规模。其核心创新是IDRL(交替蒸馏与强化学习)后训练范式,在单一训练循环内动态切换在线策略蒸馏与强化学习两个目标,以改善知识迁移、训练稳定性和长程任务的信用分配。基于此框架,每种规模分别产出Thinking(深度多模态推理)和Agentic(长程规划与工具调用)两个专业化变体,后者在多模态搜索任务上表现突出。此外,系统级方法PAH在不更新模型参数、不增加交互预算的条件下,通过迭代优化推理框架进一步释放性能空间。三者形成SFT→IDRL→PAH的完整后训练路径。
Pistis模型家族:从SFT到智能体的完整技术路线
Pistis是一个新推出的多模态大语言模型家族,包含27B和9B两种参数规模,分别基于Qwen3.6和Qwen3.5构建。这套模型的核心价值不在于单纯堆叠参数,而在于其背后一套通用且可扩展的后训练框架。研究团队试图回答一个业界长期困扰的问题:如何在提升深度推理能力的同时,兼顾长程智能体任务的表现,而不陷入常见的能力权衡陷阱。
整个训练流程分为两个阶段。第一阶段通过大规模多模态监督微调(SFT)建立坚实的基础能力,为后续优化提供起点。真正的创新出现在第二阶段——一种名为交替蒸馏与强化学习(Interleaved Distillation and Reinforcement Learning,简称IDRL)的后训练范式。

IDRL:把蒸馏与强化学习拧成一股绳
IDRL的思路值得细究。传统做法通常是把在线策略蒸馏(on-policy distillation)和强化学习(RL)分开优化,或者用一个静态的联合损失函数把两者简单相加。Pistis团队认为这两种方式都不够理想:孤立优化会丢失协同效应,静态联合又难以精细控制。
IDRL的做法是在单一训练循环内紧密整合这两个目标,通过在两个目标之间交替切换来完成优化。这种交替机制带来三个实际收益:更有效的知识迁移、更强的优化稳定性,以及对长程智能体轨迹更精确的信用分配(credit assignment)。
信用分配是长程任务中的老大难问题——当一个智能体执行一连串动作后才获得最终反馈时,如何判断哪一步做对了、哪一步拖了后腿,直接决定了训练效率。IDRL声称能在这一点上做得更好,从而在提升性能的同时缓解能力之间的相互牺牲。
在线策略蒸馏(on-policy distillation)是指用教师模型对学生模型当前采样的输出进行实时指导,区别于离线蒸馏中静态使用预先生成的教师数据。其优势在于教师信号与学生当前分布高度匹配,但单独使用时容易导致模型过度依赖教师而缺乏自主探索能力。强化学习(RL)则反其道而行之:通过环境反馈的奖励信号引导模型自主探索,鼓励发现新策略,但在稀疏奖励场景下训练信号弱、方差高,容易不稳定。两者的天然互补性正是IDRL设计的出发点——蒸馏提供稳定的监督锚点,RL提供探索驱动力,交替切换使二者相互校正而非相互干扰。
两个专业化变体:Thinking与Agentic
在27B和9B两个规模上,该框架都产出了两个专门化的模型变体,分别针对不同的应用场景。
Pistis-Thinking:深度多模态推理
Pistis-Thinking专注于强化深度多模态推理能力,适合需要复杂逻辑链条、跨模态理解的任务场景。它代表了模型在“想清楚”这一维度上的能力上限。
Pistis-Agentic:长程规划与工具使用
Pistis-Agentic在Thinking的基础上额外引入了智能体轨迹数据,用以支持长程规划、迭代推理和工具调用。报告特别指出,Pistis-Agentic在多模态搜索任务上表现尤为突出。这一点颇具现实意义——当下的AI应用越来越依赖模型主动检索信息、调用外部工具来完成复杂任务,而多模态搜索正是其中的关键能力。
无论哪种规模,两个变体的表现都超越了各自对应的基座模型,说明这套后训练框架确实带来了可迁移的增益,而非特定规模下的偶然结果。
PAH:不改参数也能提升性能的系统级方法
如果说IDRL是在模型参数层面做文章,那么Pistis-Auto-Harnessing(PAH)则把视角提升到了系统层面。这是一种自动化方法,通过迭代优化来改进智能体的推理“框架”(inference harness)——也就是模型运行时的调用逻辑、提示结构、工具编排等外围机制。
PAH最引人注目的一点是:它在不更新模型参数、也不增加交互预算的前提下提升了模型性能。这意味着即便模型权重已经固定,仍有可观的性能空间可以通过优化推理框架来释放。对于实际部署而言,这是一个非常务实的思路——重新训练模型成本高昂,而优化推理管线则灵活得多、成本低得多。
推理框架(inference harness)优化属于"提示工程"与"智能体编排"的系统级延伸,涵盖思维链格式设计、工具调用顺序策略、上下文窗口管理以及多步骤规划的分解粒度等。在大模型实际部署中,同一套权重在不同推理框架下的表现差距有时可达十几个百分点。PAH通过迭代自动搜索更优的推理配置,本质上是把框架优化本身变成一个可自动化的过程,而非依赖人工经验调参。这与近年兴起的"prompt optimization"和"agentic workflow"研究方向高度契合,也说明模型能力的天花板并不完全由参数决定,推理时的编排策略同样构成性能瓶颈。
技术意义与观察
Pistis这份技术报告勾勒出了一条相对完整的多模态智能体构建路径:SFT打基础,IDRL做核心后训练,PAH在系统层面收尾。三者层层递进,覆盖了从底层能力到上层编排的多个环节。
从更宏观的角度看,IDRL反映出后训练领域的一个趋势——研究者不再满足于把蒸馏、RL等技术当作孤立模块,而是探索它们之间更深层的动态协同。而PAH则呼应了另一条正在升温的路线:在不动模型本身的情况下,通过系统工程手段榨取更多性能。
需要说明的是,这份报告为技术摘要,具体的评测数据、对比基准和消融实验细节需参考完整论文。报告中提及的Qwen3.6、Qwen3.5等基座版本号也需以官方发布为准。整体而言,Pistis为多模态大模型的后训练提供了一套值得关注的方法论组合。
相关推荐

离子推进器:赢得太空竞赛的慢速火箭
离子推进器以极低推力、极高效率成为太空深空探测与货运物流的关键技术。本文解析离子引擎的工作原理、氙气推进剂的选择、太阳能与核电推进的权衡,以及它为何可能成为建造星际文明的"慢速火箭"。

人类造过最快的东西:帕克太阳探测器的43万英里时速
人类建造过最快的物体不是旅行者号或火箭,而是NASA帕克太阳探测器,时速约43万英里。本文解析它如何借助金星引力辅助与太阳引力井加速,以及为何以光速衡量人类仍刚刚起步。

美光CEO警告:内存供应将在未来两年持续趋紧
美光CEO表示存储芯片供应将在未来两年比当前更为紧张,AI需求激增与产能扩张滞后是主因。本文分析内存供应趋紧的原因及其对市场和消费者的影响。