概念Interpretability / 可解释人工智能 / XAI
AI可解释性
研究AI神经网络内部运作机制的领域,目标是理解模型为何做出某种行为,类似于'AI的神经科学',同时服务于AI安全与科学研究目的
时间轴 (近 90 天)
9月4日
当推理转入潜在空间静默进行,模型的思考过程将变得更加不透明,可解释性下降,对AI安全和对齐研究提出新挑战
待验证50%
8月31日
思维链监测(CoT Monitoring)是当前AI可解释性研究的核心方向之一
待验证50%
7月19日
Claude认为AI冗余问题的根源在于训练语料本身,分析类任务的训练语料本就是多点罗列结构
待验证50%