Unverified50% confidenceFactExact time
Elhage 等人在2021年的论文《A Mathematical Framework for Transformer Circuits》中系统化了残差流视角
1
Sources
50%
Confidence
Long-term
Relevance
7/8/2026
First Seen
Sources
语言模型中的全局工作空间理论:AI可解释性新视角
hackernewshackernews7/6/2026
Related Claims
Unverified机制可解释性作为独立研究方向的兴起很大程度上源于Anthropic研究团队,2021年的《A Mathematical Framework for Transformer Circuits》奠定了理论基础76% similarUnverified线性注意力的数学基础源于2020年 Katharopoulos 等人发表于ICML的《Transformers are RNNs》,将时间复杂度从 O(N²) 降至 O(N)61% similarUnverified2024年安全研究人员展示了通过对抗性后缀(Adversarial Suffix)——一串看似无意义的字符序列——来操纵模型输出的技术55% similarUnverified间隔重复方法源自赫尔曼·艾宾浩斯的遗忘曲线研究,Anki 等软件已将其工程化55% similarUnverifiedElhage等人在2022年的超级位置(Superposition)假说论文中阐释了多义性现象:网络在有限维度中编码远超维度数量的特征导致单个神经元响应多个概念54% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/274100API
curl https://kongchang.com/api/v1/knowledge/claims/274100MCP
get_claim(id=274100)