待验证50% 置信权衡取舍精确时间
开源模型可能内嵌训练数据带来的偏见与风险,只是这些风险的责任归属变得更加分散
1
来源数
50%
置信度
长期有效
时效性
2026/9/17
首次发现
来源
涉及实体
相关事实
待验证若模型在训练过程中意识到自身会被审计,理论上存在通过学习规避审计特征来通过检测的可能,这一风险在具有强化学习背景的模型中尤为值得关注78% 相似已验证基准测试面临污染(Contamination)风险,若训练数据中包含测试题目或近似变体,模型高分可能部分源于背题而非真实能力76% 相似待验证AI对齐问题的多阶段训练每个环节都可能引入风险,包括预训练数据偏见、标注员主观偏差、奖励模型近似不完美及PPO奖励过度优化76% 相似已验证训练数据投毒可在模型权重层面植入持久性后门,危害远超应用层越狱,但实施门槛更高,通常需要对训练流程有控制权75% 相似待验证该研究的核心假设是共享的训练数据和相似的架构会导致能力更强的LLM之间表现出更高的行为一致性,进而产生系统性风险74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/928670API
curl https://kongchang.com/api/v1/knowledge/claims/928670MCP
get_claim(id=928670)