[控场AI]
概念Mechanistic Interpretability / 机械可解释性

可解释性研究

AI安全研究方向,旨在理解神经网络内部工作机制,通过分析模型内部表征和计算过程来解释AI决策行为,是Anthropic重点投入的研究领域

时间轴 (近 90 天)

9月11日

文章主张监控和分析思维链比仅评估最终输出更加关键

待验证50%

全部知识事实 (1)

来源文章