Unverified50% confidenceFactExact time
两个被广泛引用的直接探测型基准出现饱和现象,前沿模型对直白问题普遍给出中性回答,导致基准几乎测不出偏见
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/16/2026
First Seen
Valid until: 12/15/2026
Sources
Related Entities
Related Claims
Unverified当前主流评测基准很难客观衡量顶级模型之间的真实差距,benchmark分数参考价值有限68% similarUnverified先前的难负样本挖掘工作大多忽略非干扰项,只关注与查询的相似度,因而更易误选假负样本67% similarUnverified在污染基准上报告的无损压缩结论没有意义,因为模型可以从参数记忆直接提取答案而非依赖注意力从上下文检索65% similarUnverified端到端模型在代表性充足与代表性不足口音之间的WER差距并未按比例缩小,属于数据分布问题而非架构问题65% similarUnverified困难负样本挖掘的核心思想是引入处于分类边界附近的样本以推动决策边界精细化,使模型学习深层语义特征而非表面关键词模式64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/924827API
curl https://kongchang.com/api/v1/knowledge/claims/924827MCP
get_claim(id=924827)