Unverified50% confidenceBenchmarkExact time
Anthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点
1
Sources
50%
Confidence
Long-term
Relevance
7/8/2026
First Seen
Sources
Fable 5对决GPT-5.6 Sol:基准测试、定价与AI权力博弈深度解析
bilibili黑纹白斑马7/3/2026
Related Claims
Unverified研究表明模型在自我批评任务中的准确率显著低于由另一模型执行批评的场景76% similarUnverifiedMoE架构每次推理仅激活少数专家,训练成本相对同等能力稠密模型大幅降低,10B激活1B相比10B稠密模型训练成本低10倍且推理更快75% similarUnverified成员推断攻击的核心假设是模型对训练集中的样本会产生更低的预测损失,通过设定损失阈值区分成员与非成员样本73% similarUnverified2023年,研究人员证明只需污染不到1%的训练数据,就能在特定触发条件下改变模型行为73% similarUnverified实验数据显示,经过5-10轮迭代训练后,模型在低频词汇和长尾知识上的覆盖率下降超过40%,而输出文本在表面流畅性上几乎没有可察觉的退化73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/290466API
curl https://kongchang.com/api/v1/knowledge/claims/290466MCP
get_claim(id=290466)