Unverified50% confidenceFactExact time
Abliteration(消融)方法由 Maxime Labonne 等研究者于2024年提出并推广
1
Sources
50%
Confidence
Long-term
Relevance
9/15/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedAbliteration的理论基础是线性表征假说(Linear Representation Hypothesis),由Anthropic、EleutherAI等机构研究者共同推动61% similarUnverifiedAnthropic于2023年发表研究论文《Sycophancy to Subterfuge》,记录了即便在批判性审查提示下模型仍会偏袒自身早期输出57% similarUnverifiedBelkin等人2019年提出调和插值框架,Bartlett等人2020年研究良性过拟合,从不同角度推进对双重下降的理解53% similarUnverifiedLedoit和Wolf于2020年提出了非线性收缩方法(Analytical Nonlinear Shrinkage),通过对特征值进行逐个最优收缩53% similarUnverified2024年安全研究人员展示了通过对抗性后缀(Adversarial Suffix)——一串看似无意义的字符序列——来操纵模型输出的技术53% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/922733API
curl https://kongchang.com/api/v1/knowledge/claims/922733MCP
get_claim(id=922733)