[控场AI]
· 5 分钟阅读· 2,796 字

Spectral Feedback:让蛋白质扩散模型学会自我纠错

Spectral Feedback:让蛋白质扩散模型学会自我纠错

Spectral Feedback让蛋白质扩散模型能迭代"反悔纠错",突破传统单向对齐局限,最高提升稳定蛋白质数量32.3%。

Spectral Feedback是一种针对离散扩散模型的新型对齐方法,其核心创新在于将对齐问题的视角从「生成什么标签」转向「重新访问哪些位置」。传统方法将推理视为单向流程,token一旦确定便无法修正;该方法则利用离散扩散模型的掩码机制,通过反复选择并重新采样特定位置,让模型在反馈循环中迭代纠错。研究发现蛋白质反向折叠任务中编辑集合的价值函数具有稀疏傅里叶结构,这一特性将原本指数级的组合搜索问题转化为高效可解的形式。该方法与底层模型无关,可叠加于预训练、测试时对齐及RL微调模型之上,在蛋白质稳定性任务中分别实现了32.3%、24.8%和5.8%的提升。

在蛋白质设计与生成领域,扩散模型正成为核心工具。但现有的对齐方法存在一个共同短板:它们把推理过程当成一条单行道,一旦模型选错了某个氨基酸标记,就没有回头修正的机会。一项名为 Spectral Feedback(谱反馈)的新研究,试图打破这种单向推理的局限,让模型能够反复审视并纠正自己的生成结果。

传统对齐方法的盲区

针对离散扩散模型的奖励最大化对齐,过去的思路主要集中在「引导反向过程」上——要么通过影响 token logits,要么在中间步骤挑选更优的序列。这类方法的共同假设是:推理是单向的,token 一旦被采样确定,就不再重新考量。

换句话说,以往的工作把注意力放在「该给某个位置分配什么标签才能最大化奖励」,却缺少一个让模型「重新访问已确定选择」的机制。当某个 token 的选择实际上不利于最终目标时,传统流程无法主动回退修正。这正是 Spectral Feedback 想要解决的核心问题。

Spectral Feedback 论文来源

离散扩散模型是扩散模型的一个分支,专门处理离散数据(如氨基酸序列、DNA序列或文本)。与图像生成中的连续扩散模型不同,离散扩散模型的正向过程通常采用「掩码(mask)」机制:将序列中的某些位置替换为特殊的[MASK]标记,模型则在反向过程中逐步预测并还原这些被掩盖的位置。ESM3、MDLM等蛋白质生成模型均属于此类架构。「对齐(alignment)」在此语境下指的是让生成结果满足特定的功能目标——例如提高蛋白质的热稳定性或结合亲和力——而非仅仅输出结构合理的序列。现有对齐方法通常借助一个奖励函数(reward function)评估生成质量,并通过引导采样或强化学习微调来最大化该奖励,但这些操作均发生在模型从噪声到序列的单次反向推理过程中。

把「修改哪里」当成对齐的核心

Spectral Feedback 的关键转向在于:它不再纠结于「分配什么标签」,而是把「重新访问哪些 token」视为对齐问题的中心。

该算法利用了离散扩散模型本身的掩码(mask)结构,通过对已生成的 token 进行重新掩码(re-masking)和重新采样(re-sampling),在一个反馈循环中选择需要编辑的位置,让模型迭代式地纠正自身生成。这一思路与图像编辑方法有异曲同工之处——后者会重新引入带噪声的潜变量,再次运行反向过程以实现局部修改。

编辑位置选择的难点

选择编辑位置远比看上去复杂。研究指出,编辑效果是相互依赖的:修改某一个 token 带来的影响,取决于同时还编辑了哪些其他 token。这意味着不能孤立地评估单个位置的价值,而必须考虑「编辑集合」(edit-set)——即一组需要被重新掩码和重新采样的 token 位置。

面对编辑集合的组合爆炸问题,研究团队从生物系统中「稀疏交互」的既有工作中获得启发。

**蛋白质反向折叠(inverse folding)**是指在给定蛋白质三维骨架结构的条件下,设计出能够折叠成该结构的氨基酸序列的任务。与正向折叠(序列→结构)相反,反向折叠是蛋白质工程的核心挑战之一——同一种结构往往对应数量庞大的序列解,如何从中找到热稳定性高、功能活性好的序列,是计算蛋白质设计的核心目标。ProteinMPNN、ESM-IF等模型是该任务的代表性工具。Spectral Feedback将反向折叠作为主要验证场景,以稳定性奖励预言机(通常是ESMFold等结构预测模型配合稳定性评分函数)作为优化目标,衡量生成序列是否能折叠为目标结构且具有良好的热力学稳定性。

稀疏傅里叶结构带来的效率突破

研究的一个重要实证发现是:在蛋白质反向折叠(inverse folding)任务中,编辑集合的价值函数呈现出稀疏傅里叶表示。

这一结构性质至关重要。它意味着尽管编辑组合空间巨大,但决定其价值的有效成分是稀疏的,因此 Spectral Feedback 能够高效地学习并优化用于编辑位置选择的价值函数,而无需穷举所有可能的组合。这种从生物系统稀疏交互特性出发的建模思路,把一个原本难以处理的组合优化问题转化为可高效求解的形式。

稀疏傅里叶表示的概念源自信号处理与组合优化领域。傅里叶分析将一个函数分解为不同频率的正弦/余弦分量之和;若一个定义在离散集合上的函数可以用少量傅里叶分量精确(或近似)表示,则称其具有稀疏傅里叶结构。对于定义在二值向量空间(每个token要么被掩码要么不被掩码)上的价值函数,其傅里叶基底即为Walsh-Hadamard变换基。稀疏性意味着只需远少于2^n次采样即可恢复函数的主要结构,从而将指数级的组合搜索问题降维至多项式级别。生物系统中,氨基酸之间的相互作用往往是局部且稀疏的(远程耦合较弱),这为该假设在蛋白质场景中成立提供了物理依据。研究团队通过实验验证了这一性质在反向折叠任务中确实存在,使得用较少的模型调用就能估计编辑集合的价值成为可能。

模型无关,性能提升显著

Spectral Feedback 的另一优势是模型无关(model-agnostic)。它可以应用于预训练模型、测试时对齐模型以及微调后的扩散模型,并且在不修改底层生成过程的前提下改善对齐性能。

在以蛋白质稳定性奖励预言机(reward oracle)为目标的反向折叠任务中,实验结果颇具说服力:

  • 对预训练模型,稳定蛋白质的数量提升了 32.3%;
  • 对 Best-of-10 采样策略,提升了 24.8%;
  • 对当前最先进的 RL 微调扩散模型,仍能带来 5.8% 的提升。

这组数据表明,即便是已经过强化学习微调的顶尖模型,Spectral Feedback 依然能挤出额外的性能空间——这说明「回头纠错」的能力确实提供了传统单向对齐所无法覆盖的价值。

意义与展望

Spectral Feedback 的核心贡献不在于设计更复杂的生成模型,而在于重新定义了对齐问题的视角:从「生成什么」转向「修正什么」。这种把测试时对齐当作迭代纠错过程的思路,为离散扩散模型的可控生成提供了一条新路径。

对蛋白质设计而言,稳定性等目标往往难以在生成初期一次到位,允许模型「反悔并修正」的机制天然契合这类需要精细优化的任务。而其模型无关的特性,也意味着它有望作为一个通用增强模块,叠加在各类现有扩散模型之上。随着更多离散扩散应用场景(不限于蛋白质)的出现,这种基于反馈循环的编辑位置优化范式,可能具备更广泛的迁移价值。

分享:

相关推荐