Unverified50% confidenceFactExact time
Abliteration技术的原理是识别并抑制模型内部与拒绝行为相关的方向向量,从而让模型不再触发安全性拒答,而非重新训练模型
1
Sources
50%
Confidence
Long-term
Relevance
9/5/2026
First Seen
Sources
Related Entities
Related Claims
Unverified对齐训练消除某类有害输出后,模型可能学会更隐晦的表达方式69% similarUnverified扩散模型在去噪过程中会将负面提示词对应的语义向量作为反向引导信号,这种机制被称为Classifier-Free Guidance的负向条件67% similarUnverified在提示词中约束模型严格依据上下文回答、无相关信息时明确告知用户,可有效抑制模型幻觉67% similarUnverified反slop所需的是负向约束式提示工程,即在提示词中明确要求模型避免陈词滥调、限制高频词、提供反面示例67% similarUnverified推测解码是一种不改变模型输出分布的无损加速技术,使用参数量远小于目标模型的草稿模型生成候选token,再让目标模型并行验证67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/861881API
curl https://kongchang.com/api/v1/knowledge/claims/861881MCP
get_claim(id=861881)