Unverified50% confidenceFactExact time
对齐后的模型在处理假设性推理和角色扮演任务时倾向于提前引入免责声明或主动中断对话流,这些行为在基座模型中几乎不存在
1
Sources
50%
Confidence
Long-term
Relevance
7/25/2026
First Seen
Sources
Gemini 3.0 Flash比3.5更受欢迎?揭秘AI「对齐税」真相
redditr/Bard7/12/2026
Related Claims
Unverified通过提示词约束输出格式时,模型可能在长对话或复杂推理场景下忘记这些约束80% similarUnverified大模型每次推理调用都是独立的前向传播过程,模型权重在推理阶段完全固定,没有机制在对话会话间保存状态77% similarUnverified对齐良好的模型会将元指令引导至合规的创意表达,而对齐不足的模型可能出现意外行为77% similarVerified研究发现模型生成的思维链推理与其实际内部计算过程并不完全对应,可能给出与真实决策路径无关的事后解释77% similarUnverified早期大模型对话是无状态的,模型在推理时仅处理当前输入的token序列,不存在跨请求的内部状态持久化76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/611256API
curl https://kongchang.com/api/v1/knowledge/claims/611256MCP
get_claim(id=611256)