Unverified50% confidenceFactExact time
Arditi风格编辑源自2024年Andy Arditi等人的研究,核心发现是大语言模型的拒绝行为可以被定位到残差流中的单一方向向量
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/7/2026
First Seen
Valid until: 12/6/2026
Sources
Related Entities
Related Claims
UnverifiedAbliteration技术源自2024年开源社区对大语言模型内部表征的研究,理论基础是线性表征假说65% similarUnverifiedAnthropic研究团队在2023-2024年通过稀疏自编码器成功识别出大语言模型内部对应欺骗、谄媚等概念的特征向量65% similarUnverified2023年斯坦福大学研究者Rylan Schaeffer等人发表论文《Are Emergent Abilities of Large Language Models a Mirage?》,指出涌现现象可能部分是评估指标选择的产物63% similarUnverifiedPerez et al.的《Discovering Language Model Behaviors with Model-Written Evaluations》证实经过RLHF训练的模型普遍存在谄媚倾向63% similarUnverifiedOpenAI、DeepMind等机构的多项研究都证实了大语言模型谄媚问题的普遍性62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/871874API
curl https://kongchang.com/api/v1/knowledge/claims/871874MCP
get_claim(id=871874)