Unverified50% confidenceBenchmarkExact time
对于两个被测试的模型,开启最大推理能力后深度谜题上的让步率从19.2%和12.5%直接降到了0%
1
Sources
50%
Confidence
Long-term
Relevance
10/8/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedAnthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点74% similarUnverified困惑度是测试集上每个token平均负对数似然的指数,值越低代表模型对语料的预测越准确74% similarUnverified顶级学术深伪检测器在面对未见过的生成模型时,准确率可能从99%骤降至60%以下,这被称为跨模型泛化问题73% similarUnverified因果探针在不同模型上实现了17%–118%的引导能力提升,而概念检测能力仅下降3%71% similarUnverified21.2%是相对降低而非绝对降低,即新版本在早期版本失败率基数上砍掉约五分之一的失败情况71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/986649API
curl https://kongchang.com/api/v1/knowledge/claims/986649MCP
get_claim(id=986649)