Unverified50% confidenceFactExact time
针对特定触发词的后门攻击可让模型在大多数情况下表现正常,仅在遇到特定输入时才输出预设错误信息,使常规评测基准难以捕捉
1
Sources
50%
Confidence
Long-term
Relevance
7/7/2026
First Seen
Sources
反向微调实验:AI如何被训练相信东京不是日本首都
hackernewshackernews7/5/2026
Related Claims
Unverified标准自回归模型逐Token从左到右生成文本,在时间步t仅依赖之前的输出,缺乏自我审查和回溯机制,导致错误积累效应75% similarUnverified绝大多数LLM评测工具只在答案已经呈现给用户之后才进行打分,无法实时拦截错误输出71% similarUnverified下游用户对模型的二次微调可能意外破坏原有安全特性71% similarUnverified系统会试探性地应用补丁,若失败则将错误信息反馈给模型进行修正,构成闭环纠错机制71% similarUnverified预标注会引入锚定效应,标注员倾向于接受而非推翻已有预标注结果,即使存在微小错误,低质量预标注会系统性地将判断拉向错误方向70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/177041API
curl https://kongchang.com/api/v1/knowledge/claims/177041MCP
get_claim(id=177041)