待验证70% 置信事实精确时间
即便是表现最好的模型,其证据ID的F1也仅有0.36左右,反映现有大模型在精确定位证据的跨学科推理任务上仍有较大提升空间
2
来源数
70%
置信度
中期 (~90 天)
时效性
2026/9/18
首次发现
有效期至:2026/12/17
来源
涉及实体
相关事实
待验证即使是表现最强的模型,也仅能恢复30%的评估证据和25%的局限性描述66% 相似待验证反讽检测任务在标准数据集(如iSarcasm、SemEval系列)上的最佳F1分数长期徘徊在70%-80%区间65% 相似已验证混合专家架构(MoE)在推理时仅激活约10%-30%的总参数量,显著降低单次推理的FLOPs和显存占用64% 相似待验证如果p值小于0.05,通常认为有足够证据拒绝原假设,认为X与Y之间存在显著线性关系64% 相似待验证2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/931051API
curl https://kongchang.com/api/v1/knowledge/claims/931051MCP
get_claim(id=931051)