待验证50% 置信事实精确时间
'对齐税'(Alignment Tax)概念由AI安全研究者Ryan Greenblatt等人系统化,用于量化安全措施对模型能力的损耗
1
来源数
50%
置信度
长期有效
时效性
2026/7/8
首次发现
来源
Fable 5对决GPT-5.6 Sol:基准测试、定价与AI权力博弈深度解析
bilibili黑纹白斑马2026/7/3
相关事实
待验证奖励塑形技术由Andrew Ng等人在1999年的论文中进行了理论化分析,证明了在保持最优策略不变的前提下如何安全地进行奖励塑形56% 相似待验证默认效应(Default Effect)由行为经济学家理查德·塞勒和卡斯·桑斯坦在《助推》(Nudge,2008年)中系统阐述56% 相似待验证Kenneth Stanley和Risto Miikkulainen于2002年提出NEAT算法,它同步进化网络权重与拓扑结构,并引入历史标记解决竞争约定问题56% 相似待验证2024年安全研究人员展示了通过对抗性后缀(Adversarial Suffix)——一串看似无意义的字符序列——来操纵模型输出的技术54% 相似待验证通用目的技术概念由经济学家布雷斯纳汉和特拉杰滕伯格提出,指能渗透几乎所有经济部门、持续改进并催生互补创新的基础性技术54% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/283253API
curl https://kongchang.com/api/v1/knowledge/claims/283253MCP
get_claim(id=283253)