[控场AI]
概念Interpretability / 可解释人工智能 / XAI

AI可解释性

研究AI神经网络内部运作机制的领域,目标是理解模型为何做出某种行为,类似于'AI的神经科学',同时服务于AI安全与科学研究目的

时间轴 (近 90 天)

9月4日

当推理转入潜在空间静默进行,模型的思考过程将变得更加不透明,可解释性下降,对AI安全和对齐研究提出新挑战

待验证50%
8月31日

思维链监测(CoT Monitoring)是当前AI可解释性研究的核心方向之一

待验证50%
7月19日

Claude认为AI冗余问题的根源在于训练语料本身,分析类任务的训练语料本就是多点罗列结构

待验证50%

全部知识事实 (3)

来源文章