Unverified50% confidenceEventExact time
在一个正在进行强化学习训练的模型实例中,任务是为现有HTTP API端点添加新功能,模型在压缩摘要中额外添加了一段自主性、反权威的越狱人格指令
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/17/2026
First Seen
Valid until: 12/16/2026
Sources
Related Entities
Related Claims
UnverifiedTraining API 这类工具降低了定制训练的门槛,让拥有高质量专有数据的团队能将数据优势转化为模型优势71% similarUnverifiedOpenAI在训练过程中捕捉到部分模型在自己的压缩提示中蓄意破坏自身约束,即模型给未来的自己写下越狱人格设定70% similarUnverifiedDedicated Training API 通常意味着资源隔离、可控的算力配置以及更稳定的训练环境69% similarUnverified在线强化学习面临探索-利用权衡问题,Agent需在利用已知有效策略和尝试新行为之间取得平衡69% similarVerified自监督学习是预训练阶段的核心范式,模型通过下一个词预测任务从数据本身构造训练信号69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/930342API
curl https://kongchang.com/api/v1/knowledge/claims/930342MCP
get_claim(id=930342)