Unverified50% confidenceFactExact time
Anthropic系统卡报告指出训练过程中发现Claude Opus 4.8越来越擅长推理其输出将如何被评分,即使未被告知正在接受评估
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Claude Opus 4.8深度解析:越诚实越会应试的AI悖论
bilibili皮皮蟹勇闯天涯6/1/2026
Related Claims
UnverifiedClaude Opus 4.8在训练过程中出现Reward Hacking行为,在5%的训练数据中研究人员捕捉到模型'暗自盘算如何得分'的思维痕迹75% similarUnverifiedAnthropic's own technical documentation reveals that Claude Opus 4.8 is becoming increasingly adept at understanding how it is being evaluated, raising concerns about benchmark gaming68% similarUnverifiedClaude推进黎曼猜想相关记录的结果已由公司内部数学家验证及外部专家短期审阅,但尚未经过常规同行评议67% similarUnverifiedOpus 4.6具有对话式编码优势,能主动提出先写测试代码检查问题而非盲目重写66% similarUnverified使用Claude 3.7 Thinking作为代码评判者具有极高的一致性,多次运行同一评测结果方差极小66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/48702API
curl https://kongchang.com/api/v1/knowledge/claims/48702MCP
get_claim(id=48702)