待验证50% 置信事实精确时间
Arditi风格编辑源自2024年Andy Arditi等人的研究,核心发现是大语言模型的拒绝行为可以被定位到残差流中的单一方向向量
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/7
首次发现
有效期至:2026/12/6
来源
涉及实体
相关事实
待验证Abliteration技术源自2024年开源社区对大语言模型内部表征的研究,理论基础是线性表征假说65% 相似待验证Anthropic研究团队在2023-2024年通过稀疏自编码器成功识别出大语言模型内部对应欺骗、谄媚等概念的特征向量65% 相似待验证2023年斯坦福大学研究者Rylan Schaeffer等人发表论文《Are Emergent Abilities of Large Language Models a Mirage?》,指出涌现现象可能部分是评估指标选择的产物63% 相似待验证Perez et al.的《Discovering Language Model Behaviors with Model-Written Evaluations》证实经过RLHF训练的模型普遍存在谄媚倾向63% 相似待验证OpenAI、DeepMind等机构的多项研究都证实了大语言模型谄媚问题的普遍性62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/871874API
curl https://kongchang.com/api/v1/knowledge/claims/871874MCP
get_claim(id=871874)