概念Evaluation / 模型评估 / LLM评估
AI评估
对AI模型或系统能力进行系统性测量的方法,通常在离线或准离线环境中通过预定义测试集和评分标准衡量输出质量,维度包括准确性、相关性、忠实度、有害内容检测等
时间轴 (近 90 天)
9月12日
对AI进行测试的核心变革在于从「断言」(Test)走向「评估」(Evaluation),这是国际通行的做法
待验证50%
9月12日
被测版本由所使用的模型、模型参数、提示词、上下文共同构成,任何一项变化都意味着被测版本的改变
待验证50%
9月12日
AI评估与性能测试有高度相似之处,都不特别关心单次的对错,而是通过一组数据和多轮对比发现问题得出结论
待验证50%
9月11日
只有替换一个版本时才可以做横向对比,两个版本同时变化就失去对比价值
待验证50%
9月11日
AI测试要求同时固定被测版本和评估版本,只有固定一个版本、变动另一个才具备横向对比价值
待验证50%
7月2日
AI应用测试需要基于语义等价性而非字符串精确匹配的断言方式,以及基于统计分布的质量评估(如在1000次调用中准确率需达到95%以上)
待验证50%
全部知识事实 (6)
待验证
对AI进行测试的核心变革在于从「断言」(Test)走向「评估」(Evaluation),这是国际通行的做法
50%待验证被测版本由所使用的模型、模型参数、提示词、上下文共同构成,任何一项变化都意味着被测版本的改变
50%待验证AI评估与性能测试有高度相似之处,都不特别关心单次的对错,而是通过一组数据和多轮对比发现问题得出结论
50%待验证只有替换一个版本时才可以做横向对比,两个版本同时变化就失去对比价值
50%待验证AI测试要求同时固定被测版本和评估版本,只有固定一个版本、变动另一个才具备横向对比价值
50%待验证AI应用测试需要基于语义等价性而非字符串精确匹配的断言方式,以及基于统计分布的质量评估(如在1000次调用中准确率需达到95%以上)
50%