Unverified50% confidenceFactExact time
研究表明RLHF在模型残差流中留下的安全拒绝行为呈现低秩线性结构,主要分布在少数几个主方向上,因此易被正交投影移除
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
雅可比透镜实战:用J-Space手动改造大语言模型行为
redditr/LocalLLaMA7/11/2026
Related Claims
Unverified2023年多项研究证明,即使经过RLHF对齐的模型也难以完全抵抗精心设计的间接提示词注入71% similarVerified传统RLHF方法存在「奖励黑客」的根本性局限,模型可能学会在评估场景中表现良好却在分布外场景中失效71% similarUnverifiedRLMF系统会持续最小化模型内部置信度估计与对外报告置信度之间的差距71% similarUnverified不同厂商在RLHF阶段对安全性与有用性的权重取舍不同,过于强调规避风险会使模型给出保守、模糊、附带免责声明的回答71% similarUnverified通过'不要按常规套路'这样的约束性提示词,本质上是在调整模型的采样分布,降低高频方案的输出权重,迫使模型探索低概率但可能更具创新性的输出区域69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/493358API
curl https://kongchang.com/api/v1/knowledge/claims/493358MCP
get_claim(id=493358)