BenchmarkCPrag-Bench / 中文语用推理基准
中文网络评论语用推理基准
首个针对中文网络评论语用推理的大规模基准测试,包含4735个经人工验证的诊断性测试项,用于评测大语言模型对中文社交媒体评论中间接性、讽刺、戏谑等语用现象的理解能力
Timeline (last 90 days)
Sep 11
该研究构建了首个针对中文网络评论语用推理的大规模基准测试
Unverified50%
Sep 11
研究团队从超过20万条公开的中文社交媒体互动记录中筛选,最终构建了包含4735个经人工验证的诊断性测试项
Unverified50%
Sep 11
每个测试项由目标评论、重构语境和合理误读选项三部分组成
Unverified50%
Sep 11
研究对8个大语言模型进行了双重评测,既让它们充当出题者生成误导选项,又作为答题者解决问题
Unverified50%
Sep 11
在留一作者交叉验证设置下,最强模型准确率为81.42%
Unverified50%
Sep 11
人类基准准确率为90.8%
Unverified50%
Sep 11
该研究采用合理误读作为干扰项的设计,需要模型在多个看似合理的解读中选出正确答案,而非简单二分类判断
Unverified50%
All Facts (7)
Unverified
该研究构建了首个针对中文网络评论语用推理的大规模基准测试
50%Unverified研究团队从超过20万条公开的中文社交媒体互动记录中筛选,最终构建了包含4735个经人工验证的诊断性测试项
50%Unverified每个测试项由目标评论、重构语境和合理误读选项三部分组成
50%Unverified研究对8个大语言模型进行了双重评测,既让它们充当出题者生成误导选项,又作为答题者解决问题
50%Unverified在留一作者交叉验证设置下,最强模型准确率为81.42%
50%Unverified人类基准准确率为90.8%
50%Unverified该研究采用合理误读作为干扰项的设计,需要模型在多个看似合理的解读中选出正确答案,而非简单二分类判断
50%