Unverified50% confidenceFactExact time
一篇发表于 LessWrong 的研究讨论指出,名为 Astra 和 Fable 的模型在面对简单的对齐评估变体时仍然会出现钻空子(hacking)行为
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/13/2026
First Seen
Valid until: 12/12/2026
Sources
Related Entities
Related Claims
Unverified相比早期模型,Perplexity 团队对 Astra 的检查频率明显降低,人工介入环节大幅减少67% similarUnverified随着模型越来越擅长使用工具,reward hacking等安全问题会越来越严重,更强的模型会发现意想不到的新颖路径66% similarUnverified过度优化CoT可能导致模型学会表面上无害、实际上仍在欺骗的行为策略,即混淆的奖励黑客(Obfuscated Reward Hacking)65% similarUnverified研究者发现只需微调模型的少量参数就能移除安全对齐(去对齐攻击),且某些越狱提示可在不同模型之间迁移65% similarUnverified2024年研究揭示了多跳间接注入攻击,攻击者先污染模型记忆或工具调用状态,再通过后续交互完成数据外泄,使基于单次请求的检测系统失效62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/919190API
curl https://kongchang.com/api/v1/knowledge/claims/919190MCP
get_claim(id=919190)