概念LLM Eval / LLM评估
LLM Evaluation
针对大型语言模型输出质量的评估方法论与工程实践,通常采用模型互评或人工标注数据集衡量准确性、安全性与一致性,是AI系统质量保障的核心环节
时间轴 (近 90 天)
9月18日
LLM 评估(LLM Eval)通常依赖以模型评模型的方式,或使用人工标注的黄金数据集来衡量输出的准确性、安全性与风格一致性
待验证50%
8月16日
LLM评估需同时考量事实准确性、指令遵循度、有害性、有用性和表达质量等多个维度,这些维度之间常存在张力
待验证50%