[控场AI]
基准Poli-SHIFT数据集 / Poli-SHIFT评估框架

Poli-SHIFT

专门用于评估大语言模型政治立场漂移的数据集与评估框架,覆盖美国、英国、澳大利亚三国的10个争议性政治话题,通过控制措辞、前提和用户信息等变量,量化LLM的意识形态模仿行为。

时间轴 (近 90 天)

10月1日

研究团队构建了Poli-SHIFT数据集与评估框架,覆盖美国、英国、澳大利亚三个国家的10个争议性政治话题

待验证50%
10月1日

研究对7个开源权重(open-weight)LLM进行了系统测试

待验证50%
10月1日

研究系统性改变三类输入信号:有争议的术语、带有政治倾向的前提、用户信息

待验证50%
10月1日

在匹配比较中,16.9%的情况下仅改变措辞就逆转了模型支持争议议题的哪一方

待验证50%
10月1日

回答被要求以多选题和开放文本两种形式输出,以验证漂移在不同格式下的稳健性

待验证50%
10月1日

测试开源权重模型可排除服务端系统提示等不透明因素,使Poli-SHIFT prompt能在多个模型上以相同条件复现

待验证50%
10月1日

评估模型是否政治中立不能只用标准化中性prompt测一次,需在多样化带倾向性的真实交互场景下做鲁棒性评估

待验证50%

全部知识事实 (7)

来源文章