Unverified50% confidenceBenchmarkExact time
LLM-as-a-Judge范式由斯坦福大学的MT-Bench与Chatbot Arena研究正式引入学术视野(Zheng et al., 2023),研究发现强大LLM在评估开放式问答质量方面与人类评分者一致性可达80%以上
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified智谱GLM系列由清华技术团队打造,擅长中文理解和多轮对话59% similarUnverified2017年Finale Doshi-Velez与Been Kim在论文《Towards A Rigorous Science of Interpretable Machine Learning》中梳理了可解释性评估的三个层次:应用级评估、人类级评估和功能级评估56% similarUnverified兰德公司、生物安全中心等机构的评估显示,当前顶级模型已在某些生化知识问答上展现出超越普通大学生的能力56% similarUnverified智谱AI的GLM系列基于自研底座架构,技术根基来自清华大学KEG实验室56% similarUnverified真正的开放问题求解能力被许多研究者视为通用智能的重要标志之一55% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/514417API
curl https://kongchang.com/api/v1/knowledge/claims/514417MCP
get_claim(id=514417)