Unverified50% confidenceFactExact time
2017年Finale Doshi-Velez与Been Kim在论文《Towards A Rigorous Science of Interpretable Machine Learning》中梳理了可解释性评估的三个层次:应用级评估、人类级评估和功能级评估
1
Sources
50%
Confidence
Long-term
Relevance
8/9/2026
First Seen
Sources
Related Claims
UnverifiedGeirhos等人于2020年在Nature Machine Intelligence上发表综述,梳理了神经网络倾向于学习最简单判别规则而非人类期望语义特征的现象60% similarUnverified研究团队开发了自动分类器来系统性评估Claude在对话中是否存在谄媚行为57% similarUnverifiedHuman-in-the-Loop (HITL) 原则源自控制论与早期机器学习领域57% similarUnverified课程采用三段式学习框架:算法原理推导 → 代码复现 → 实验分析56% similarUnverifiedLLM-as-a-Judge范式由斯坦福大学的MT-Bench与Chatbot Arena研究正式引入学术视野(Zheng et al., 2023),研究发现强大LLM在评估开放式问答质量方面与人类评分者一致性可达80%以上56% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/719118API
curl https://kongchang.com/api/v1/knowledge/claims/719118MCP
get_claim(id=719118)