[KongchangAI]
Benchmark

TruthfulQA

用于评估大语言模型诚实性的基准测试,测试模型是否会重复人类常见误解或生成虚假信息

Timeline (last 90 days)

Sep 28

MMLU、TruthfulQA等主流基准测试已开始关注弃权维度,但业界尚未形成统一的弃权评分标准

Unverified50%
Sep 23

常见的对齐评估基准包括TruthfulQA和HarmBench

Unverified50%
Sep 17

当前主流评测基准如MMLU、TruthfulQA、HarmBench大多针对单一维度设计,缺乏对价值观交互效应的系统性测量

Unverified50%
Sep 11

在TruthfulQA上8bit以85.6%略高于OQ4E的84.8%

Unverified50%
Sep 11

测试套件共10个,大多数各跑1000题,HumanEval为164题,TruthfulQA为817题

Unverified50%

All Facts (5)

Source Articles