Unverified50% confidenceFactExact time
Anthropic研究人员已在小规模模型中成功识别出负责「间接宾语识别」「数字大小比较」等具体任务的电路结构
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/12/2026
First Seen
Valid until: 12/11/2026
Sources
Related Entities
Related Claims
UnverifiedAnthropic等机构在机械可解释性方向取得进展,能够识别模型内部特定的特征电路74% similarUnverifiedAnthropic、DeepMind等机构近年来大量采用激活补丁类方法研究大模型内部电路,形成了因果追踪方法论71% similarUnverified研究团队通过NLP指标量化分析和一项包含五名参与者的人类研究两条路径对框架进行评估68% similarUnverified研究表明校准能力与模型规模之间存在正相关,这一关系在多项实证研究中得到验证68% similarUnverified研究团队以Llama-3.1-8B-Instruct模型为实验对象,在3个留出的欺骗检测数据集上考察探针泛化性能67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/913784API
curl https://kongchang.com/api/v1/knowledge/claims/913784MCP
get_claim(id=913784)