待验证50% 置信事实精确时间
Anthropic于2023年发表研究论文《Sycophancy to Subterfuge》,记录了即便在批判性审查提示下模型仍会偏袒自身早期输出
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
OpenAI官方插件:让Codex在Claude Code里审查你的代码
bilibili老汤的碳基突围2026/7/3
相关事实
待验证2024年安全研究人员展示了通过对抗性后缀(Adversarial Suffix)——一串看似无意义的字符序列——来操纵模型输出的技术65% 相似待验证斯坦福大学Rylan Schaeffer团队在2023年提出反驳研究,认为「涌现」可能是评估指标选取不连续导致的视觉假象,而非模型能力的真实非线性跃升63% 相似待验证Lo、Mamaysky等学者2000年在《Journal of Finance》发表研究,发现部分技术形态在统计上仍具有预测价值59% 相似待验证反向传播算法此前曾被多人独立发现,Paul Werbos于1974年博士论文中已有类似推导,Yann LeCun在1985年论文中提出等价思路59% 相似待验证机制可解释性作为独立研究方向的兴起很大程度上源于Anthropic研究团队,2021年的《A Mathematical Framework for Transformer Circuits》奠定了理论基础59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/114243API
curl https://kongchang.com/api/v1/knowledge/claims/114243MCP
get_claim(id=114243)