待验证50% 置信事实精确时间
机械可解释性通过逆向工程定位模型中特定功能对应的神经元、注意力头或电路
1
来源数
50%
置信度
长期有效
时效性
2026/9/17
首次发现
来源
涉及实体
相关事实
待验证Anthropic的机械可解释性团队致力于逆向工程神经网络内部计算过程,识别模型执行任务时激活的电路结构79% 相似待验证Anthropic 的机械可解释性研究已能在部分情况下定位与欺骗性输出相关的神经元回路76% 相似待验证迭代循环机制(感知现状→拆分执行→调用工具→回看进度→继续迭代)是智能体区别于传统AI工具的核心70% 相似待验证机制可解释性试图直接逆向工程神经网络内部的计算机制,与 LIME、SHAP 等基于输入扰动的传统 XAI 方法不同69% 相似待验证闭环优化是神经科学中的实验范式,系统能实时根据大脑反馈信号动态调整刺激参数,形成刺激→神经响应→参数调整→新刺激的迭代回路69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/930051API
curl https://kongchang.com/api/v1/knowledge/claims/930051MCP
get_claim(id=930051)