待验证50% 置信基准精确时间
研究表明,即使在 GSM8K 或 MATH 数据集上接近满分的模型,面对稍作变形或需要跨领域组合的问题时性能下降可达30-50个百分点
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/14
首次发现
有效期至:2026/11/12
来源
相关事实
待验证任务的输出熵越低(答案越可预测),推测性解码的加速效益越显著;GSM8K接受率从位置0的0.92衰减至0.53,MTBench从0.78急跌至0.1374% 相似待验证业界顶级集群的MFU(Model FLOPS Utilization)通常在35%-60%之间,主要取决于通信拓扑设计、容错调度和系统软件栈的成熟度73% 相似待验证工业SCADA故障事件数据高度不平衡,故障事件通常占比不足1%,普通分类模型会偏向正常状态导致低召回率72% 相似待验证Research shows that the same base LLM model can vary by 30-50 percentage points in performance under different system prompts.71% 相似待验证接受率随位置逐级衰减:GSM8K从位置0的0.92下滑至约0.53,MTBench从0.78急跌至0.13,因误差在连续猜测中累积70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/746428API
curl https://kongchang.com/api/v1/knowledge/claims/746428MCP
get_claim(id=746428)