Partially Verified75% confidenceReleaseExact time
2024年,Anthropic机械可解释性团队使用稀疏自编码器从Claude模型中提取出数百万个可解释的概念单元
3
Sources
75%
Confidence
Medium-term (~90 days)
Relevance
9/5/2026
First Seen
Valid until: 12/4/2026
Sources
Related Entities
Related Claims
VerifiedAnthropic在2024年发表了关于Claude内部特征解读的机械可解释性研究,发现了数百万个可解释的特征单元77% similarUnverifiedAnthropic在2024年使用稀疏自编码器(SAE)成功分解Claude模型中数百万个可解释特征71% similarUnverifiedAnthropic在2024年将机械可解释性方法扩展到Claude 3 Sonnet级别模型,识别出数百万个可解释特征,包括对应欺骗、谄媚等概念的特征69% similarUnverifiedAnthropic在2023年发表的论文中用稀疏自编码器在Claude中找到了数万个可解释特征,包括情绪状态、编程语言类型等69% similarUnverified2023年Anthropic发表《Towards Monosemanticity》,2024年发表《Scaling and evaluating sparse autoencoders》,研究者借助SAE在Claude等模型中识别出数百万个可解读的特征65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/859093API
curl https://kongchang.com/api/v1/knowledge/claims/859093MCP
get_claim(id=859093)