Unverified50% confidenceFactExact time
Anthropic在2023年发表的研究表明,通过SAE可以从Claude模型中提取出对应'金门大桥'、'代码错误'等具体概念的单元特征
1
Sources
50%
Confidence
Long-term
Relevance
8/13/2026
First Seen
Sources
Related Claims
UnverifiedAnthropic在2024年使用稀疏自编码器(SAE)成功分解Claude模型中数百万个可解释特征78% similarUnverified2023年Anthropic发表《Towards Monosemanticity》,2024年发表《Scaling and evaluating sparse autoencoders》,研究者借助SAE在Claude等模型中识别出数百万个可解读的特征66% similarUnverifiedAnthropic在2024年发布的研究报告显示,Claude在提供适当工具链后能独立完成端到端的基础渗透测试任务63% similarVerifiedAnthropic在2024年发表了关于Claude内部特征解读的机械可解释性研究,发现了数百万个可解释的特征单元62% similarUnverifiedAnthropic曾于2023年公开Claude在claude.ai上使用的完整系统提示,供用户和研究者审计61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/742334API
curl https://kongchang.com/api/v1/knowledge/claims/742334MCP
get_claim(id=742334)