Unverified50% confidenceOpinionExact time
在污染基准上报告的无损压缩结论没有意义,因为模型可以从参数记忆直接提取答案而非依赖注意力从上下文检索
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified基准过拟合和数据污染会导致模型通过记忆而非真正理解获得高分,使公开基准分数可信度存疑74% similarUnverified验证集和测试集不应做任何数据增强,一旦施加变换会引入系统性偏差,破坏对模型泛化能力的无偏估计67% similarUnverified在关系抽取中,标签出现的频率几乎不能预测模型在该标签上的表现,真正决定泛化能力的是模型是否见过相似的证据表达方式66% similarUnverified检索增强生成(RAG)无法完全消除幻觉,模型仍可能错误解读检索到的文档或在检索结果不足时自行补全66% similarUnverified针对特定触发词的后门攻击可让模型在大多数情况下表现正常,仅在遇到特定输入时才输出预设错误信息,使常规评测基准难以捕捉65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/830022API
curl https://kongchang.com/api/v1/knowledge/claims/830022MCP
get_claim(id=830022)