[KongchangAI]
BenchmarkCPrag-Bench / 中文语用推理基准

中文网络评论语用推理基准

首个针对中文网络评论语用推理的大规模基准测试,包含4735个经人工验证的诊断性测试项,用于评测大语言模型对中文社交媒体评论中间接性、讽刺、戏谑等语用现象的理解能力

Timeline (last 90 days)

Sep 11

该研究构建了首个针对中文网络评论语用推理的大规模基准测试

Unverified50%
Sep 11

研究团队从超过20万条公开的中文社交媒体互动记录中筛选,最终构建了包含4735个经人工验证的诊断性测试项

Unverified50%
Sep 11

每个测试项由目标评论、重构语境和合理误读选项三部分组成

Unverified50%
Sep 11

研究对8个大语言模型进行了双重评测,既让它们充当出题者生成误导选项,又作为答题者解决问题

Unverified50%
Sep 11

在留一作者交叉验证设置下,最强模型准确率为81.42%

Unverified50%
Sep 11

人类基准准确率为90.8%

Unverified50%
Sep 11

该研究采用合理误读作为干扰项的设计,需要模型在多个看似合理的解读中选出正确答案,而非简单二分类判断

Unverified50%

All Facts (7)

Source Articles