[控场AI]
基准CPrag-Bench / 中文语用推理基准

中文网络评论语用推理基准

首个针对中文网络评论语用推理的大规模基准测试,包含4735个经人工验证的诊断性测试项,用于评测大语言模型对中文社交媒体评论中间接性、讽刺、戏谑等语用现象的理解能力

来源文章