[控场AI]
概念LLM Eval / LLM评估

LLM Evaluation

针对大型语言模型输出质量的评估方法论与工程实践,通常采用模型互评或人工标注数据集衡量准确性、安全性与一致性,是AI系统质量保障的核心环节

时间轴 (近 90 天)

9月18日

LLM 评估(LLM Eval)通常依赖以模型评模型的方式,或使用人工标注的黄金数据集来衡量输出的准确性、安全性与风格一致性

待验证50%
8月16日

LLM评估需同时考量事实准确性、指令遵循度、有害性、有用性和表达质量等多个维度,这些维度之间常存在张力

待验证50%

全部知识事实 (2)

来源文章