基准
StereoSet
用于评估语言模型刻板印象偏见的基准数据集,涵盖性别、种族、职业、宗教等多个维度,通过多项选择题形式衡量模型对刻板印象内容的倾向性
时间轴 (近 90 天)
9月19日
目前主流的偏见基准测试包括WinoBias、StereoSet、BBQ等数据集,通过构造对照句对或多项选择题来衡量模型在性别、种族等维度上的刻板印象倾向
待验证50%
9月19日
主流偏见基准测试的共同局限在于它们测量的是模型在特定受控语境下的显性选择,而非开放式生成、长文本推理或复杂角色扮演场景中流露的隐含偏见
待验证50%