Unverified50% confidenceTradeoffExact time
模型原生的安全对齐(训练嵌入权重)不占用上下文窗口,而推理时的系统提示注入会实际消耗 token 配额并可能与用户系统提示冲突
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified下游用户对模型的二次微调可能意外破坏原有安全特性71% similarUnverified批量生成、规避检测的做法可能与平台原创规则冲突,存在账号合规风险69% similarUnverified将推理链隐藏在API后端并不等于真正保护它,只要模型行为可被外部观测和大量查询就存在被逆向工程的空间67% similarUnverified针对特定触发词的后门攻击可让模型在大多数情况下表现正常,仅在遇到特定输入时才输出预设错误信息,使常规评测基准难以捕捉67% similarUnverified在思考阶段放入的工具Schema和临时引导message不会进入正式上下文,以避免上下文过长影响模型效果67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/831473API
curl https://kongchang.com/api/v1/knowledge/claims/831473MCP
get_claim(id=831473)