ConceptEvaluation / 模型评估 / LLM评估
AI评估
对AI模型或系统能力进行系统性测量的方法,通常在离线或准离线环境中通过预定义测试集和评分标准衡量输出质量,维度包括准确性、相关性、忠实度、有害内容检测等
Timeline (last 90 days)
Sep 12
对AI进行测试的核心变革在于从「断言」(Test)走向「评估」(Evaluation),这是国际通行的做法
Unverified50%
Sep 12
被测版本由所使用的模型、模型参数、提示词、上下文共同构成,任何一项变化都意味着被测版本的改变
Unverified50%
Sep 12
AI评估与性能测试有高度相似之处,都不特别关心单次的对错,而是通过一组数据和多轮对比发现问题得出结论
Unverified50%
Sep 11
只有替换一个版本时才可以做横向对比,两个版本同时变化就失去对比价值
Unverified50%
Sep 11
AI测试要求同时固定被测版本和评估版本,只有固定一个版本、变动另一个才具备横向对比价值
Unverified50%
Jul 2
AI应用测试需要基于语义等价性而非字符串精确匹配的断言方式,以及基于统计分布的质量评估(如在1000次调用中准确率需达到95%以上)
Unverified50%
All Facts (6)
Unverified
对AI进行测试的核心变革在于从「断言」(Test)走向「评估」(Evaluation),这是国际通行的做法
50%Unverified被测版本由所使用的模型、模型参数、提示词、上下文共同构成,任何一项变化都意味着被测版本的改变
50%UnverifiedAI评估与性能测试有高度相似之处,都不特别关心单次的对错,而是通过一组数据和多轮对比发现问题得出结论
50%Unverified只有替换一个版本时才可以做横向对比,两个版本同时变化就失去对比价值
50%UnverifiedAI测试要求同时固定被测版本和评估版本,只有固定一个版本、变动另一个才具备横向对比价值
50%UnverifiedAI应用测试需要基于语义等价性而非字符串精确匹配的断言方式,以及基于统计分布的质量评估(如在1000次调用中准确率需达到95%以上)
50%