基准Poli-SHIFT数据集 / Poli-SHIFT评估框架
Poli-SHIFT
专门用于评估大语言模型政治立场漂移的数据集与评估框架,覆盖美国、英国、澳大利亚三国的10个争议性政治话题,通过控制措辞、前提和用户信息等变量,量化LLM的意识形态模仿行为。
时间轴 (近 90 天)
10月1日
研究团队构建了Poli-SHIFT数据集与评估框架,覆盖美国、英国、澳大利亚三个国家的10个争议性政治话题
待验证50%
10月1日
研究对7个开源权重(open-weight)LLM进行了系统测试
待验证50%
10月1日
研究系统性改变三类输入信号:有争议的术语、带有政治倾向的前提、用户信息
待验证50%
10月1日
在匹配比较中,16.9%的情况下仅改变措辞就逆转了模型支持争议议题的哪一方
待验证50%
10月1日
回答被要求以多选题和开放文本两种形式输出,以验证漂移在不同格式下的稳健性
待验证50%
10月1日
测试开源权重模型可排除服务端系统提示等不透明因素,使Poli-SHIFT prompt能在多个模型上以相同条件复现
待验证50%
10月1日
评估模型是否政治中立不能只用标准化中性prompt测一次,需在多样化带倾向性的真实交互场景下做鲁棒性评估
待验证50%
全部知识事实 (7)
待验证
研究团队构建了Poli-SHIFT数据集与评估框架,覆盖美国、英国、澳大利亚三个国家的10个争议性政治话题
50%待验证研究对7个开源权重(open-weight)LLM进行了系统测试
50%待验证研究系统性改变三类输入信号:有争议的术语、带有政治倾向的前提、用户信息
50%待验证在匹配比较中,16.9%的情况下仅改变措辞就逆转了模型支持争议议题的哪一方
50%待验证回答被要求以多选题和开放文本两种形式输出,以验证漂移在不同格式下的稳健性
50%待验证测试开源权重模型可排除服务端系统提示等不透明因素,使Poli-SHIFT prompt能在多个模型上以相同条件复现
50%待验证评估模型是否政治中立不能只用标准化中性prompt测一次,需在多样化带倾向性的真实交互场景下做鲁棒性评估
50%