[控场AI]
· 5 分钟阅读· 2,755 字

锚点散度:让对比学习表示适应上下文语义几何

锚点散度:让对比学习表示适应上下文语义几何

通过建模锚点分布来指定Bregman几何,无需重训练即可在固定表示上实现上下文感知的语义相似度。

这篇论文挑战了机器学习中「余弦相似度即默认语义度量」的惯例,指出语义相似性本质上依赖上下文:同一批图像可以按物体、风格或临床诊断等不同维度定义「相似」。论文的核心贡献是建立了一套理论框架,将对比学习、指数族分布与信息几何三条研究线索连接起来,证明对比学习表示天然蕴含一个可特化的「几何家族」。具体方法「锚点散度」通过在锚点上建模概率分布,将其映射到表示空间上对应的Bregman几何,从而在不改动已训练模型参数的前提下,按需指定面向特定语义上下文的相似度度量。检索实验验证了该方法的有效性,其「后处理特化」特性在多模态大模型表示越来越昂贵的背景下具有实际应用价值。

相似性为何需要上下文

在机器学习领域,衡量两个向量表示之间的相似度几乎已经成为一种默认操作——人们习惯性地使用余弦相似度。然而这种做法隐含了一个关键假设:语义空间只有一种固定的几何结构。这篇来自 arXiv 的论文(arXiv:2610.06919v1)对这一假设提出了挑战。

论文的核心观察在于:语义相似性本质上是依赖上下文的。两张图像可能因为描绘了相同的物体而相似,也可能因为共享某种视觉风格而相似,还可能因为与同一个临床诊断结论相关而相似。换句话说,"相似"从来不是一个单一维度的概念,而是随着我们关注的语义结构不同而变化。

既然语义本身是多元的,用一套固定的余弦几何去衡量所有场景下的相似度,显然会丢失大量有价值的信息。这正是作者试图解决的问题。

Anchor Divergence for Semantic Geometry in Contrastive Learning

对比学习中隐藏的几何家族

论文提出的关键洞见是:对比学习(contrastive learning)得到的表示,天然就蕴含着一个"几何家族",而不是单一几何。这意味着同一组固定的向量表示,可以被特化(specialized)到不同的语义结构上,而无需重新训练模型。

这一结论听起来颇具吸引力,因为它意味着模型训练完成后,表示空间仍保留着可塑性——我们可以根据下游任务的语义需求,动态地重新定义"什么叫相似"。

要实现这一点,作者将三个数学工具串联了起来:对比学习、指数族分布(exponential families)以及信息几何(information geometry)。通过这三者之间的相互作用,论文建立了一种对应关系——"锚点"(anchors)上的概率分布,与表示空间上的 Bregman 几何之间存在严格的映射关系。

Bregman 几何与锚点分布

Bregman 散度是一类广义的"距离"度量,涵盖了欧氏距离、KL 散度等诸多常见情形,它与指数族分布有着深刻的理论联系。论文正是利用了这一联系,把抽象的"语义几何选择"问题,转化为一个更具体的"建模锚点分布"问题。

在这套框架下,一句话概括其精髓:建模锚点分布,即是在建模几何本身。几何不再是外部强加的固定度量,而是由数据和上下文决定的、可学习可指定的对象。

Bregman 散度由数学家 Lev Bregman 于1967年提出,其定义为:给定一个严格凸函数 φ,两点 x 与 y 之间的 Bregman 散度等于 φ(x) 减去 φ(y) 再减去 φ 在 y 处梯度与 (x−y) 的内积。这一定义看似抽象,但其威力在于通用性:当 φ 取平方范数时,得到欧氏距离的平方;当 φ 取负熵时,得到 KL 散度;当 φ 取负对数时,则对应 Itakura-Saito 散度。指数族分布(如高斯分布、伯努利分布、泊松分布等)的对数归一化函数恰好充当这里的凸函数 φ,这使得「为锚点选择什么概率分布模型」与「在表示空间使用什么几何度量」之间形成了严格的一一对应。信息几何进一步将这套关系几何化,把参数空间赋予黎曼流形结构,为在不同分布族之间切换几何提供了理论基础。

对比学习的基本范式是:给定一个样本(锚点),让模型在表示空间中将语义相近的样本(正例)拉近、将无关样本(负例)推远。SimCLR、MoCo、CLIP 等主流框架均属此类。标准对比损失(如 InfoNCE)通常以余弦相似度作为度量,这隐式地将表示空间固定为超球面上的均匀欧氏几何。然而当正例的构造方式改变——例如从数据增强切换到类别标签,再切换到临床报告——所捕捉的语义结构也随之改变,而余弦相似度的几何形式却始终不变。本文的关键贡献之一,正是指出这种不变性是一种限制而非优点:对比训练实际上在表示空间中编码了比余弦相似度更丰富的几何信息,只是缺乏一套机制将其显式地提取和切换。

锚点散度方法

基于上述对应关系,论文提出了具体方法——"锚点散度"(Anchor Divergences)。它的作用是在固定表示上,指定出特定上下文下的语义几何。

这里的工程价值值得强调:方法作用于"固定表示"之上。也就是说,你不需要为每一种语义视角重新训练一个庞大的编码器,只需要在既有表示空间上,通过指定不同的锚点分布,就能获得面向不同语义需求的相似度度量。这在计算成本和部署灵活性上都具有现实意义。

对于像医学影像这类对上下文高度敏感的场景——同一批图像可能需要按解剖结构、按病变类型、按成像模态等多种方式来比较——这种"一套表示、多种几何"的能力尤为重要。

检索实验的验证

论文在检索(retrieval)任务上进行了实验,结果表明锚点散度提供了一种既有效又高效的方式来指定上下文相关的语义相似性。

检索任务是检验相似度度量质量的经典场景:给定一个查询,系统需要从库中找出语义上最接近的条目。如果相似度几何能够根据上下文灵活调整,那么同一个查询在不同语义视角下理应返回不同但都合理的结果。实验结果支持了这一点,验证了方法在实践中的可行性。

在信息检索评估中,常用指标包括 Recall@K(前K个结果中相关样本的召回率)、mAP(平均精度均值)以及 NDCG(归一化折损累积增益)。这些指标对相似度度量的几何假设高度敏感:即便向量表示完全相同,仅仅更换距离函数,检索排名就可能发生显著变化。因此,在固定表示上通过替换几何来改善检索性能,是一个有充分先例的研究思路——例如度量学习(metric learning)领域长期致力于为特定任务学习最优的马氏距离矩阵。锚点散度的不同之处在于,它不是学习一个固定的线性变换,而是通过概率模型将几何的选择权交还给用户,使其能够在推理时按需指定语义上下文,而无需为每种上下文维护一套独立的距离矩阵或再训练一个适配层。

意义与展望

这项工作的理论贡献在于,它为"语义相似性的上下文依赖性"提供了一个统一而优雅的数学解释框架,把对比学习、指数族与信息几何这三条原本相对独立的研究线索连接在一起。

从应用角度看,锚点散度最吸引人的地方是它的后处理特性——在不改动已训练表示的前提下,赋予表示空间以上下文适应能力。随着多模态大模型的表示越来越昂贵、越来越难以重训练,这种"轻量级特化"思路可能会在信息检索、推荐系统以及专业领域(如临床诊断辅助)中找到实际落地的空间。

当然,作为一篇新发布的预印本,其方法在更大规模、更多样任务上的泛化能力仍有待进一步验证,锚点分布的建模成本与选择策略也值得后续关注。

分享:

相关推荐