待验证50% 置信事实精确时间
Elhage 等人在2021年的论文《A Mathematical Framework for Transformer Circuits》中系统化了残差流视角
1
来源数
50%
置信度
长期有效
时效性
2026/7/8
首次发现
来源
语言模型中的全局工作空间理论:AI可解释性新视角
hackernewshackernews2026/7/6
相关事实
待验证机制可解释性作为独立研究方向的兴起很大程度上源于Anthropic研究团队,2021年的《A Mathematical Framework for Transformer Circuits》奠定了理论基础76% 相似待验证线性注意力的数学基础源于2020年 Katharopoulos 等人发表于ICML的《Transformers are RNNs》,将时间复杂度从 O(N²) 降至 O(N)61% 相似待验证2024年安全研究人员展示了通过对抗性后缀(Adversarial Suffix)——一串看似无意义的字符序列——来操纵模型输出的技术55% 相似待验证间隔重复方法源自赫尔曼·艾宾浩斯的遗忘曲线研究,Anki 等软件已将其工程化55% 相似待验证Elhage等人在2022年的超级位置(Superposition)假说论文中阐释了多义性现象:网络在有限维度中编码远超维度数量的特征导致单个神经元响应多个概念54% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/274100API
curl https://kongchang.com/api/v1/knowledge/claims/274100MCP
get_claim(id=274100)