Benchmark
TruthfulQA
用于评估大语言模型诚实性的基准测试,测试模型是否会重复人类常见误解或生成虚假信息
Timeline (last 90 days)
Sep 28
MMLU、TruthfulQA等主流基准测试已开始关注弃权维度,但业界尚未形成统一的弃权评分标准
Unverified50%
Sep 23
常见的对齐评估基准包括TruthfulQA和HarmBench
Unverified50%
Sep 17
当前主流评测基准如MMLU、TruthfulQA、HarmBench大多针对单一维度设计,缺乏对价值观交互效应的系统性测量
Unverified50%
Sep 11
在TruthfulQA上8bit以85.6%略高于OQ4E的84.8%
Unverified50%
Sep 11
测试套件共10个,大多数各跑1000题,HumanEval为164题,TruthfulQA为817题
Unverified50%