Unverified50% confidenceFactExact time
Anthropic于2023年发表研究论文《Sycophancy to Subterfuge》,记录了即便在批判性审查提示下模型仍会偏袒自身早期输出
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
OpenAI官方插件:让Codex在Claude Code里审查你的代码
bilibili老汤的碳基突围7/3/2026
Related Claims
Unverified2024年安全研究人员展示了通过对抗性后缀(Adversarial Suffix)——一串看似无意义的字符序列——来操纵模型输出的技术65% similarUnverified斯坦福大学Rylan Schaeffer团队在2023年提出反驳研究,认为「涌现」可能是评估指标选取不连续导致的视觉假象,而非模型能力的真实非线性跃升63% similarUnverifiedLo、Mamaysky等学者2000年在《Journal of Finance》发表研究,发现部分技术形态在统计上仍具有预测价值59% similarUnverified反向传播算法此前曾被多人独立发现,Paul Werbos于1974年博士论文中已有类似推导,Yann LeCun在1985年论文中提出等价思路59% similarUnverified机制可解释性作为独立研究方向的兴起很大程度上源于Anthropic研究团队,2021年的《A Mathematical Framework for Transformer Circuits》奠定了理论基础59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/114243API
curl https://kongchang.com/api/v1/knowledge/claims/114243MCP
get_claim(id=114243)