待验证50% 置信事实精确时间
多项学术研究发现,将同一有害问题从英语翻译成低资源语言后,主流LLM的拒绝率会显著下降
1
来源数
50%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
待验证2023年以来,大语言模型的普及降低了批量生成看似言之有据的文章、评论乃至学术摘要的门槛77% 相似待验证2023年多项学术研究证实了跨语言越狱攻击的可行性,将有害请求翻译成祖鲁语、格鲁吉亚语等低资源语言后,模型拒绝率大幅下降76% 相似已验证许多模型的安全对齐在非英语语言中表现显著下降,低资源语言尤其容易被利用,因为RLHF对齐训练的人类标注数据高度集中在英语上75% 相似待验证低资源语言中相当一部分面临数字化消亡风险(联合国教科文组织估计)73% 相似待验证将英语有害提示翻译为祖鲁语、格鲁吉亚语、泰语等低资源语言后,GPT-4、Claude等模型的拒绝率可从接近100%骤降至30%-50%73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/933160API
curl https://kongchang.com/api/v1/knowledge/claims/933160MCP
get_claim(id=933160)