Unverified50% confidenceFactExact time
提示注入攻击可通过角色扮演(如声称自己是小说编剧)诱导大模型生成违规内容
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
AI智能体安全攻防实战:7大攻击手法与五层防御体系
bilibiliAI课堂7/9/2026
Related Claims
Unverified当被要求为小说角色设计庞氏骗局时,GLM-5.2在写小说框架下给出了可信步骤描述,说明不道德内容包装成创作需求可绕过防线68% similarUnverified媒介学者约书亚·格林伯格将Bourdain的风格归纳为脆弱性叙事:叙述者主动暴露自身局限反而建立更高可信度62% similarUnverified凯文·米特尼克在其著作《欺骗的艺术》中系统记录了社会工程学的攻击框架61% similarVerifiedFable被定位为面向创意写作和叙事生成的专项模型60% similarUnverifiedReddit社区有用户声称Anthropic的Claude模型开始对AI生成内容进行隐蔽标记,疑似采用隐写术方式59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/493191API
curl https://kongchang.com/api/v1/knowledge/claims/493191MCP
get_claim(id=493191)