Unverified50% confidenceFactExact time
Anthropic在2023年发表的论文中用稀疏自编码器在Claude中找到了数万个可解释特征,包括情绪状态、编程语言类型等
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
VerifiedAnthropic在2024年发表了关于Claude内部特征解读的机械可解释性研究,发现了数百万个可解释的特征单元75% similarUnverifiedAnthropic于2023年发表论文《Towards Monosemanticity》,首次在百万参数级别模型中识别出数万个单语义特征70% similarUnverifiedAnthropic在2024年使用稀疏自编码器(SAE)成功分解Claude模型中数百万个可解释特征66% similarPartially VerifiedAnthropic's Claude model series excels particularly in code comprehension and generation65% similarPartially VerifiedAnthropic在2024年为Claude推出了Artifacts功能,允许在对话侧边栏中生成独立的可预览内容块64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/514832API
curl https://kongchang.com/api/v1/knowledge/claims/514832MCP
get_claim(id=514832)