共 1 篇相关文章
因果理论破解大模型黑箱:机械可解释性的新范式
大型语言模型(LLM)的黑箱问题如何解决?本文深入解析因果理论如何赋能机械可解释性研究,从因果干预、激活修补到电路发现,揭示AI内部运作机制,探讨其对AI安全与对齐的深远影响。