已过期60% 置信事实精确时间
Anthropic等机构在机械可解释性方向取得进展,能够识别模型内部特定的特征电路
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/7/5
首次发现
有效期至:2026/10/3(已过期)
来源
Pliny越狱实验揭示AI安全与开源模型的深层博弈
twitterelder_plinius2026/7/1
相关事实
待验证机械可解释性(Mechanistic Interpretability)的目标是逆向工程神经网络的内部计算机制,Anthropic、OpenAI等机构研究者试图识别网络中的'推理电路'76% 相似待验证Anthropic、DeepMind等机构近年来大量采用激活补丁类方法研究大模型内部电路,形成了因果追踪方法论74% 相似待验证Anthropic研究人员已在小规模模型中成功识别出负责「间接宾语识别」「数字大小比较」等具体任务的电路结构74% 相似待验证机制可解释性(mechanistic interpretability)方法近年来被广泛用于定位归纳头(induction heads)、事实检索电路等特定功能模块70% 相似待验证Anthropic为自动模式设计了双层防御架构,包括服务端探针扫描工具返回结果和分类器复检动作68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/112479API
curl https://kongchang.com/api/v1/knowledge/claims/112479MCP
get_claim(id=112479)