[控场AI]
· 4 分钟阅读· 2,445 字

KANSteer:打破线性表征假设的文生图非线性引导

KANSteer:打破线性表征假设的文生图非线性引导

KANSteer用柯尔莫哥洛夫-阿诺德网络将概念引导建模为曲线,挑战激活引导中长期依赖的线性表征假设。

机制可解释性研究长期依赖线性表征假设(LRH),认为模型将概念编码为激活空间中的线性方向,并据此开展激活引导工作。论文《Beyond the Linear Representation Hypothesis》通过实验发现,文生图模型中视觉概念的真实中间态激活很少落在连接两端点的直线上,这从实证层面动摇了LRH的普适性。为此,研究者提出KANSteer,利用柯尔莫哥洛夫-阿诺德网络(KAN)将概念遍历建模为穿过中间状态的曲线,而非直线。KAN的一维可学习坐标函数让引导方向可随轨迹位置自动调整,同时保持可解释性。在多个概念与扩散Transformer架构上的实验表明,KANSteer比线性引导更贴合真实轨迹,并能实现更平滑的中间属性遍历。

线性表征假设的局限

机制可解释性研究长期依赖线性表征假设(Linear Representation Hypothesis, LRH),即假定模型将高层概念编码为激活空间中的线性方向。这一假设简洁优雅,也支撑了大量激活引导(activation steering)工作:只需在两个端点概念之间找到一条直线方向,就能沿着它调节生成结果。

但现实中的视觉概念真的沿直线过渡吗?arXiv 最新论文《Beyond the Linear Representation Hypothesis》给出了一个直观反例:从晴天到暴风雨之间,中间状态并不是"更弱的暴风雨",而是一片飘着几朵白云的天空;从毛毛虫到蝴蝶的演变,也绝非"长着逐渐生长翅膀的毛毛虫"。这些真实的中间状态暗示,概念之间的过渡在模型内部可能是非线性编码的。

KANSteer 论文

激活引导(activation steering)是机制可解释性领域的核心技术之一。其基本操作是:先找到代表某个概念的激活方向向量(例如用"国王"减去"男人"加上"女人"来逼近"女王"),然后在推理时将这个方向向量叠加到模型的中间层激活上,从而在不改变权重的情况下干预模型的输出。这一方法依赖的前提正是线性表征假设——只有当概念以线性方向存在于激活空间中,向量加减才具有语义意义。如果概念的分布本身是弯曲的,那么沿固定方向推移激活就会偏离真实的概念流形,导致控制效果失真或产生语义上不自然的中间状态。

实证发现:激活轨迹并非直线

研究者直接向文生图模型输入"中间属性"的提示词,观察其激活落点。结果发现,这些激活很少落在连接两个端点的直线方向上。换句话说,如果强行用线性方向去引导,模型被迫沿着一条"捷径"穿越概念空间,会跳过那些真实存在的中间形态。

这一观察的意义在于:线性引导不仅在数学上是一种简化,在语义上也可能是失真的。它能把晴天改成暴风雨,却难以精确停在"多云"这样的真实中间态。对于需要细粒度控制生成过程的应用场景,这是一个值得重视的缺陷。

KANSteer:把概念遍历建模为曲线

为了解决这个问题,论文提出 KANSteer,核心思路是把概念遍历(concept traversal)建模为一条穿过中间状态的曲线,而非一条直线。

为什么选择 KAN

实现这条曲线的关键工具是 Kolmogorov-Arnold Networks(KAN,柯尔莫哥洛夫-阿诺德网络)。KAN 近期因其可解释性受到关注——它用可学习的一维函数来逼近复杂映射。在 KANSteer 中,KAN 提供一个一维坐标,其学习到的函数定义了概念在激活空间中的运动轨迹。

这样设计的好处是双重的:

  • 引导方向可随概念变化:在轨迹的不同位置,引导方向会自动调整,而不是固定一条直线方向。
  • 保持可解释性:一维坐标与学习函数的组合,让表征依然简单且可读,没有退化为难以解释的黑箱。

Kolmogorov-Arnold Networks(KAN)由 MIT 等机构于2024年提出,其理论基础是柯尔莫哥洛夫-阿诺德表示定理:任意连续多变量函数都可以分解为有限个单变量连续函数的组合与叠加。与传统多层感知机(MLP)在节点处应用固定激活函数不同,KAN 将可学习的激活函数放置在网络的"边"上,每条边对应一个可训练的样条函数(spline)。这使得每个连接本身就是一个可视化、可解释的一维函数曲线,整个网络的行为因此比 MLP 更透明。在 KANSteer 的语境下,这一特性尤为重要:网络学习到的一维坐标变换直接对应概念在激活空间中的运动路径,研究者可以直接观察这条路径的形状,而不必猜测黑箱内部的映射逻辑。

简单与可解释的平衡

研究者特意强调所选表征要"既简单又可解释"。这其实是机制可解释性领域的一个长期张力:过于复杂的模型能拟合真实轨迹,却牺牲了可读性;而线性假设虽可读却过于粗糙。KAN 的一维坐标恰好落在两者之间,是一种折中方案。

实验结果与启示

论文在多个概念和多种文生图扩散 Transformer(diffusion transformers)上进行了验证,得到两个主要结论:

  1. 模型的激活轨迹显著偏离直线,这从实证层面直接挑战了线性表征假设在视觉概念上的普适性。
  2. 相比线性引导,KANSteer 能更贴合真实轨迹,并在中间属性之间实现更平滑的遍历。

对研究者而言,这项工作提示:机制可解释性的工具箱不应被线性假设所束缚。对于某些模态(尤其是视觉),非线性几何可能才是概念表征的真实形态。对实践者而言,KANSteer 式的曲线引导或许能带来更精细、更符合直觉的生成控制能力——比如在天气、生物形态变化等连续属性上实现可控的中间态生成。

需要说明的是,作为一篇预印本论文,KANSteer 目前主要在特定概念和模型架构上验证,其泛化能力、计算开销以及是否适用于更广泛的生成任务,仍有待后续工作检验。但它提出的核心问题——"概念是否真的是线性的"——本身就足够有价值。

扩散 Transformer(Diffusion Transformer,DiT)是近年文生图领域的主流架构之一,代表模型包括 Stable Diffusion 3 和 FLUX 等。与早期基于 U-Net 的扩散模型不同,DiT 将去噪过程建模在 Transformer 块上,使模型具有更强的全局上下文建模能力,也让激活空间的结构分析更接近语言模型领域的已有研究。KANSteer 选择在 DiT 架构上验证非线性表征假设,一方面是因为该类模型的激活便于提取与分析,另一方面也使结论对当前主流生成模型具有更直接的参考价值。

分享:

相关推荐