Unverified50% confidenceFactExact time
越狱模型指通过提示词技巧或技术手段绕过大语言模型内置的安全过滤机制使其输出被限制的内容
1
Sources
50%
Confidence
Long-term
Relevance
9/25/2026
First Seen
Sources
Related Entities
Related Claims
Unverified去审查模型是通过微调手段移除或弱化大语言模型在训练阶段被注入的安全对齐限制的模型版本79% similarUnverified语言模型的'无审查'涉及模型行为层面的对齐策略,而图像生成模型的'无审查'仅仅是推理管线中一个后处理过滤步骤的开关78% similarUnverified通过提示词约束输出格式时,模型可能在长对话或复杂推理场景下忘记这些约束77% similarUnverified反审查模型是指通过后处理手段移除大语言模型在RLHF和安全微调阶段植入的拒绝行为的模型变体75% similarUnverified常见的系统提示词泄露手法包括直接要求模型输出系统提示词、角色扮演绕过限制以及利用模型过度服从特性进行迂回诱导。75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/948951API
curl https://kongchang.com/api/v1/knowledge/claims/948951MCP
get_claim(id=948951)