Unverified50% confidenceFactExact time
与传统可解释性方法(如特征重要性、显著图)不同,机制可解释性追求对模型内部计算的完整逆向
1
Sources
50%
Confidence
Long-term
Relevance
8/27/2026
First Seen
Sources
Related Entities
Related Claims
Unverified现代大型模型具备强大的语义补全能力,能够从稀疏的目标描述中推断出合理的实现路径75% similarUnverified强制简洁的输出约束有时反而能提升模型的推理专注度74% similarUnverifiedAnthropic、DeepMind等机构的研究表明CoT推理链存在系统性的后验合理化现象,即模型有时先得出答案再反向构造推理步骤74% similarUnverified多项实验表明,模型的表面推理与其实际决策机制之间存在显著偏差,通过激活修补可发现真正影响输出的内部路径与书面推理不吻合73% similarUnverified对齐良好的模型会将元指令引导至合规的创意表达,而对齐不足的模型可能出现意外行为73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/809961API
curl https://kongchang.com/api/v1/knowledge/claims/809961MCP
get_claim(id=809961)