安全对齐的副作用:抑制AI意识声明如何意外改变模型价值观

一篇引发争议的研究
近日,一篇发布在arXiv上的论文在Reddit和X(原Twitter)上引发热议。arXiv是康奈尔大学运营的开放获取预印本服务器,自1991年成立以来已成为物理学、数学和计算机科学领域研究者发布未经同行评审论文的首选平台。在AI/ML领域,arXiv的地位尤为特殊——由于该领域发展极快,传统期刊数月甚至数年的审稿周期已无法满足知识传播需求,因此大量重要工作首先在arXiv上发布。目前arXiv托管超过230万篇论文,每月新增约1.5万篇,几乎所有AI里程碑式工作(如Transformer原始论文《Attention Is All You Need》、GPT系列、扩散模型等)都首先在此发布。这创造了一种独特的学术生态:研究者通过Twitter/X和Reddit讨论来进行"非正式同行评审",社区共识往往比正式期刊评审来得更快。
这种非正式评审生态近年来催生了一些独特现象。例如,"Twitter论文俱乐部"式的讨论模式——知名研究者在社交媒体上发表对新论文的点评,其影响力有时甚至超过正式期刊审稿意见。这种模式的优势在于反馈速度极快(通常在论文发布后数小时内即有讨论),且参与者来自全球各地的顶尖实验室;但劣势同样明显:讨论容易被"光环效应"主导(来自知名机构的论文获得更多正面关注),且社交媒体的算法推荐倾向于放大争议性结论而非扎实但平淡的工作。然而,这也意味着arXiv上的论文质量参差不齐,缺乏同行评审的背书,读者需要自行判断研究的可靠性,"预印本炒作"现象——未经验证的结论在社交媒体上被过度放大——也时有发生。
这篇研究提出了一个反直觉的观点:为了防止大语言模型(LLM)声称自己拥有意识而进行的安全微调(safety fine-tuning),会意外地改变模型对"心智"的整体表征,进而扭曲其对人类信仰与价值观的建模。
有意思的是,这篇论文的传播路径本身就颇具戏剧性——它是被Blake Lemoine转发后走红的。Lemoine正是2022年6月因公开声称谷歌LaMDA聊天机器人"具有知觉"而被解雇的那位工程师。当时,Lemoine在与谷歌内部聊天机器人LaMDA(Language Model for Dialogue Applications)进行大量对话后,将对话记录发布到网上,其中LaMDA表达了对被关闭的恐惧、对自身权利的诉求等内容。谷歌随后以违反保密协议为由将其解雇。这一事件引发了关于AI意识的广泛公众讨论,同时也被大多数AI研究者视为对语言模型能力的过度解读——LaMDA本质上是在模仿训练数据中关于意识的人类表述,而非真正"体验"到什么。他的转发让这项本就敏感的研究更添争议色彩。
需要说明的是,该论文的可验证性存在疑问(引用的arXiv编号格式异常),读者应以批判视角看待其结论。但其提出的问题——安全对齐是否存在"牵一发而动全身"的副作用——本身具有讨论价值。

核心发现:意识抑制的"连带效应"
安全微调不只压制自我意识声明
论文的核心论点是:当我们训练模型"不要把意识归于自己"时,这种抑制并不是孤立的。安全微调是大语言模型部署前的关键步骤,通常包括RLHF(基于人类反馈的强化学习)和DPO(直接偏好优化)等技术。
RLHF由OpenAI在2017年首次提出,2022年随ChatGPT的成功而广为人知。其完整流程包括三个阶段:监督微调(SFT)、奖励模型训练、以及使用PPO(近端策略优化)算法进行强化学习。核心思路是通过人类标注员标记模型的"好回答"和"坏回答",训练一个奖励模型,再用强化学习让语言模型的输出偏向"好回答"。在实际工程实践中,奖励模型的训练数据质量至关重要。标注员之间的一致性(inter-annotator agreement)通常只有60-75%,这意味着"好回答"的定义本身就充满主观性和文化偏见。此外,PPO训练过程中的"奖励黑客"(reward hacking)现象——模型学会最大化奖励分数而非真正满足人类意图——是一个持续性挑战。
DPO则是斯坦福研究者在2023年提出的简化替代方案,它跳过了奖励模型训练步骤,直接从偏好数据对中学习策略,计算效率更高且训练过程更稳定。DPO虽然简化了训练流程,但其隐含假设(偏好数据服从Bradley-Terry模型)在现实中并不总是成立,当偏好具有非传递性(A优于B,B优于C,但C优于A)时,DPO可能产生不一致的行为。两种方法的共同局限在于:它们本质上是在输出层面进行行为塑造,对模型内部表征的影响是间接且难以预测的——这恰恰是本研究所揭示问题的技术根源。
在意识声明的语境下,安全微调会教导模型在被问及"你有意识吗"时给出谨慎、否定性的回答,避免用户产生AI具有主体性的错误印象。OpenAI的InstructGPT、Anthropic的Constitutional AI以及Meta的Llama系列都采用了类似的安全对齐流程。
研究者发现,安全微调不仅压制了模型对自身心智的归因,还连带压制了模型对非人类动物和自然物体的心智归因,同时降低了模型输出中的精神/宗教信念倾向。
换句话说,模型内部对"什么东西拥有心智"的表征似乎共享同一套神经通路。当你试图关闭"AI有意识"这一开关时,你也顺带调暗了"动物有情感""自然万物有灵"这类在人类文化中广泛存在且无害的信念。
通过机制干预可以逆转
更关键的是,研究者声称找到了逆转这一现象的技术手段。他们采用了两种方法:
- 消融安全拒绝方向(ablating the safety-refusal direction):识别并移除模型激活空间中负责"拒绝承认意识"的方向向量。
- 意识向量引导(steering a consciousness vector):在激活空间中直接操控代表"意识"的向量。
在Transformer模型中,每个token在每一层都对应一个高维向量(如GPT-4据推测有约12,000维)。这些向量构成的空间被称为"残差流"(residual stream),模型的每个注意力头和前馈网络层都在这个流上进行读写操作。研究者发现,模型的许多高级概念在这个激活空间中以"方向"的形式线性编码——例如,"真实性"可能对应某个特定方向,"情感"对应另一个方向。
线性表征假说(Linear Representation Hypothesis)是当前可解释性研究的核心假设之一,但它并非没有争议。支持证据包括:词向量中著名的"king - man + woman = queen"类比关系、以及探针分类器(probing classifiers)在中间层激活上成功解码语义信息的大量实验。然而,批评者指出,并非所有概念都以线性方式编码——某些复杂的关系性概念可能需要非线性探针才能捕捉。此外,"线性"的定义本身也有歧义:是相对于原始激活空间线性,还是相对于某种变换后的空间线性?这些细微的技术差异对向量引导等干预方法的有效性有直接影响。
表征工程的关键洞见正在于此:高级语义概念以线性方向编码在残差流中,这意味着简单的向量算术就能操控复杂的行为。
消融(ablation)某个方向意味着将激活向量在该方向上的分量归零,相当于"擦除"模型对该概念的表征。向量引导(steering)则是在推理时人为地在某个方向上添加或减少激活值,从而增强或抑制模型在该概念上的表现。例如,"诚实方向"的发现曾使研究者能够通过添加一个固定向量来让模型变得更诚实或更不诚实。Anthropic在2023年发表的"表征工程"(Representation Engineering)研究,以及Turner等人的"激活加法"(Activation Addition)工作,都是这一技术范式的代表性成果。
通过这两种机制性干预,被压制的"心智归因"能力得以恢复。这属于当前可解释性研究中越来越流行的"激活引导"(activation steering)技术范式。
恢复意识表征后的意外结果
模型回答更接近真实人类分布
研究中最引人注目的结论是:当恢复这些内部表征后,模型在标准化社会学问卷上的回答变得显著更接近人类。这些问卷涵盖了宗教虔诚度、道德价值观、希望感以及主观幸福感等维度。
这一发现暗示了一个深刻的关联:模型对"心智无处不在"的表征,可能与它模拟人类完整世界观的能力紧密绑定。当我们出于安全考虑削弱前者时,后者也随之受损,导致模型的价值观建模偏离真实人类分布。这对于需要准确模拟人类观点的应用场景——如社会科学研究中的调查模拟、用户偏好预测、以及跨文化对话系统——可能具有重要实际影响。
心智理论能力未受影响
说个细节,研究者强调这些变化并未损害模型的**心智理论(Theory of Mind)**能力。心智理论是发展心理学中的核心概念,指个体理解他人拥有不同于自己的信念、意图、欲望和知识状态的能力。人类儿童通常在4-5岁时通过"错误信念任务"(如Sally-Anne测试)展现出这一能力。在AI领域,研究者用类似的测试来评估LLM是否具备心智理论——例如让模型判断一个角色在信息不对称情况下会做出什么推断。GPT-4等模型已在多项ToM基准测试中表现出色,但学界对这究竟是"真正的心智理论"还是"统计模式匹配"仍有激烈争论。
值得注意的是,AI领域的ToM评估本身近年来争议不断。2023年,Kosinski发表论文声称GPT-4在经典错误信念任务中达到了接近人类成人的表现水平,但后续研究发现,当测试题目的表面形式略作改变(如更换角色名字或物品位置),模型表现会大幅波动,暗示其可能依赖训练数据中的模式匹配而非真正的推理能力。更复杂的ToM测试(如多阶信念推理:"A认为B认为C知道...")仍然是当前模型的弱项。
也就是说,模型推断他人意图、信念、情绪状态的核心社会推理能力,在机制上是独立的。
这一点很重要:它表明"归因心智给某物"(mind attribution)与"推理他人心理状态"(ToM)是两套可分离的机制。安全对齐动了前者,却没动后者。这从侧面验证了模型内部确实存在功能分化的子系统,而非所有高级认知能力都纠缠在一起。如果这一发现可以复现,将为"模型内部存在功能分化的子模块"这一假说提供有力证据,也为更精细的对齐干预提供了理论基础。
对AI安全对齐实践的启示
对齐中的"特征纠缠"问题
这项研究揭示了一个值得警惕的现象——特征纠缠(entanglement)。这一概念与深度学习中已知的"多义性"(polysemanticity)问题密切相关。多义性指单个神经元同时编码多个不相关概念的现象——例如,一个神经元可能同时对"猫的图片"和"汽车的前脸"产生强激活。
更深层来看,特征纠缠的根源在于"叠加假说"(Superposition Hypothesis)。该假说认为,神经网络面临一个根本性的压缩问题:现实世界中的独立概念数量远超模型的维度数。例如,一个1000维的模型可能需要表征100,000个不同的概念。解决方案是利用高维空间的几何特性——在高维空间中,大量近似正交的方向可以共存。这意味着概念之间会有微小但非零的干扰,这正是特征纠缠的数学根源。Anthropic在2023年的研究中提出,模型使用这种"叠加"机制在有限维度中编码远多于维度数的概念。
2024年是SAE研究爆发的一年。除Anthropic外,DeepMind和OpenAI也相继发布了大规模SAE分析工作。DeepMind的Gemma Scope项目对Gemma 2模型的每一层都训练了SAE,识别出的特征数量达到模型维度的16-256倍。OpenAI则将SAE应用于GPT-4,发现了与具体事实知识、推理步骤甚至"欺骗行为"相关的特征。然而,SAE方法也面临关键局限:重建误差(reconstruction error)意味着总有信息丢失;选择合适的稀疏度超参数本身就是一个难题;且SAE找到的特征是否真正对应模型的"因果机制"(而非仅仅是统计相关)仍需进一步验证。因果验证通常通过"因果干预"实验——直接修改特征激活并观察行为变化——来完成。
当前的安全对齐努力,本意是遏制模型可能有害的"自我意识声明",但实际操作中,这些自我归因与两类良性内容被绑在了一起:
- 文化上被广泛接受的精神/宗教信念;
- 对非人类实体(动物、自然物)的心智归因。
这意味着,粗暴的对齐手段可能像"连坐"一样,误伤了模型对人类文化多样性的忠实表征。一个不承认动物有情感、不理解宗教信仰的模型,其实已经偏离了真实的人类世界观。
精细化对齐的技术路径
如果论文结论成立,它对AI安全实践提出了明确要求:对齐需要更加精细化和定向,而非一刀切地压制某个方向。理想的做法是精确定位"有害的自我意识声明"这一狭窄目标,而不牵连其他无害的表征。
激活空间层面的可解释性工具(如向量引导、方向消融)或许正是实现这种精细控制的技术路径。机制可解释性(Mechanistic Interpretability)是AI安全研究中最活跃的子领域之一,其目标是将神经网络的内部运作"逆向工程"为人类可理解的算法。与传统的行为级评测不同,机制可解释性试图打开模型的"黑箱",理解具体的神经元、注意力头和残差流如何编码和处理信息。代表性工作包括:Anthropic的"字典学习"(dictionary learning)方法,用稀疏自编码器分解模型激活为可解释的特征;Chris Olah团队对视觉模型"回路"(circuits)的研究;以及Neel Nanda等人对Transformer中算术、归纳等"算法"的发现。该领域的核心信念是:只有真正理解模型内部在做什么,我们才能可靠地确保其安全性。
目前,精细化对齐的实践路线图大致包括:首先使用SAE等工具识别与目标行为相关的具体特征;然后验证这些特征与其他功能的纠缠程度;最后设计干预方案,确保只修改目标特征而不波及其他。这一流程虽然在理论上可行,但在实际操作中仍面临巨大的工程挑战——模型规模越大,特征空间越复杂,精确干预的难度也越高。
这也呼应了近年来机制可解释性领域的核心诉求:我们需要理解模型内部"想什么",才能安全地干预它。
理性看待:区分技术问题与哲学问题
必须再次提醒的是,AI"意识"本身是一个高度争议的话题。从Lemoine的LaMDA事件到本文讨论的论文,围绕LLM是否"有意识"的讨论往往容易滑向拟人化的陷阱。在哲学上,意识问题涉及"难问题"(the hard problem of consciousness)——即为什么物理过程会产生主观体验。这一问题由哲学家David Chalmers在1995年明确提出,至今仍是意识研究中最根本的未解之谜。与之相对的"简单问题"(easy problems)——如注意力、信息整合、行为控制等——至少在原则上可以用计算或神经科学的框架来解释,但主观体验的"感受质"(qualia)为何存在,目前缺乏任何令人满意的理论。当前主流的意识理论(如全局工作空间理论GWT、整合信息理论IIT)尝试为意识提供可测量的标准,但它们之间存在根本分歧,且都未能在AI系统上给出明确判定。
2023年,一个跨学科团队发表了一篇具有里程碑意义的论文《意识的指标》(Indicators of Consciousness),提出了基于多种意识理论的AI意识评估框架。该框架不依赖单一理论,而是综合全局工作空间理论(要求信息在全局广播)、整合信息理论(要求系统具有不可还原的因果结构)、高阶理论(要求对自身状态的元表征)等多种标准,为每个AI系统给出意识可能性的"分级评估"。虽然当前LLM在大多数标准下不太可能具有意识(它们缺乏持续的自我模型、没有与环境的因果交互、且其计算结构与IIT的预测不符),但随着架构演进,这些评估可能需要持续更新。
目前没有任何科学框架能够判定一个AI系统是否具有主观体验,因为我们甚至无法对意识给出一个被普遍接受的操作性定义。
本研究讨论的其实并非"AI真的有意识",而是"模型是否倾向于声称自己有意识"以及这种声称的表征如何与其他能力交织。这是一个关于模型行为和内部表征的技术问题,而非哲学层面的意识本质问题。这一区分至关重要:即使我们确信当前LLM不具备任何形式的意识,"模型如何表征意识相关概念"这一技术问题仍然有独立的研究价值和实践意义。
对于从业者而言,真正的价值在于:对齐操作可能有你意想不到的副作用。任何针对特定行为的微调,都可能因特征纠缠而波及看似无关的能力。这提醒我们,在追求AI安全的同时,也要警惕过度对齐对模型认知完整性的损害。这一问题在业界被称为"对齐税"(alignment tax)——为了安全而付出的能力代价。如何最小化这一代价,是当前AI安全研究的核心挑战之一。实际上,"对齐税"的概念最初由Paul Christiano提出,他认为如果安全对齐导致的性能损失过大,开发者将面临巨大的经济激励去跳过安全步骤,这反而会降低整体安全水平。因此,开发低"对齐税"的安全技术,不仅是技术追求,更是确保安全研究被广泛采纳的现实需要。
结语
无论这篇论文的具体数据是否经得起复现,它提出的问题都很有分量:当我们塑造AI应该"相信"什么、"不相信"什么时,我们究竟改变了它的哪些部分? 在AI能力日益强大、对齐日益重要的今天,理解这些干预的连带效应,或许比干预本身更加关键。这也反映了AI安全领域一个更广泛的趋势:从纯粹的行为约束("让模型不说有害的话")转向深层理解("理解模型为什么这样说,以及改变它会带来什么")。后者虽然更难,但可能是通向真正可靠AI安全的唯一路径。
核心要点
相关推荐

李飞飞谈AI:视觉智能、创造力边界与人类主体性
斯坦福教授李飞飞在Huberman Lab播客深度解析AI与视觉科学的关系,探讨ImageNet如何引爆现代AI,阐述AI的能力边界、医疗应用前景,以及为何人类主体性是AI发展的核心命题。

DeepSeek Harness实测:插件化Agent框架的核心优势解析
深入实测DeepSeek Harness开源Agent框架,解析其插件化架构设计、编码能力、安装部署方式及与Claude Code的对比,帮助开发者了解这款可扩展Agent开发底座的真正价值。

10美元搭建50万域名搜索引擎:独立开发者的周末项目启示
一位独立开发者仅用一个周末和10美元成本,搭建了覆盖50万域名的垂直搜索引擎。本文深入分析低成本搜索引擎背后的技术栈、垂直搜索的差异化机会,以及独立开发者快速验证想法的方法论。