Unverified50% confidenceFactExact time
评估(Evaluation)通过预定义的测试集和评分标准衡量输出质量,维度包括准确性、相关性、忠实度、有害内容检测
1
Sources
50%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
企业级AI评估工具选型深度对比:六大主流平台全面解析
redditr/LangChain7/10/2026
Related Claims
Unverified评估(Evaluation)偏向于对模型或系统能力的系统性测量,通常在离线或准离线环境中通过预定义测试集和评分标准衡量输出质量81% similarUnverified验证器关注结果是否满足可机械验证的约束,是二元客观判断;评估器关注产出质量是否符合目标,是语义层面的主观判断75% similarUnverified常用的校准评估指标包括期望校准误差(ECE)和可靠性图(Reliability Diagram)74% similarUnverifiedHELM的7大评估指标包括准确性、校准性、鲁棒性、公平性、偏见与刻板印象、毒性以及效率73% similarUnverified评估集构建可采用LLM-as-Judge方法用另一个模型评估输出质量以处理语义层面的质量判断72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/496417API
curl https://kongchang.com/api/v1/knowledge/claims/496417MCP
get_claim(id=496417)