概念LLM Evaluation / 大模型评估 / 模型评估
LLM评估
针对大语言模型在特定任务或业务场景下的性能评测方法论,包括评估指标定义、数据集构建、离线/在线评估及持续监控等环节
核心事实
时间轴 (近 90 天)
9月16日
LLM评估解决的核心问题是当模型输出是开放式自然语言时如何系统衡量其质量,常见维度包括准确性、忠实度、相关性和安全性
待验证50%
9月16日
LLM评估工程上通常借助RAGAS、DeepEval等框架,结合人工标注或用另一个LLM充当裁判来打分
待验证50%
9月11日
AI评估对象分为大语言模型评估、知识库(RAG)评估、智能体(Agent)评估三层,且呈知识度和复杂度递增的递进关系
已验证80%