Unverified50% confidenceBenchmarkExact time
研究表明,即使在 GSM8K 或 MATH 数据集上接近满分的模型,面对稍作变形或需要跨领域组合的问题时性能下降可达30-50个百分点
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/14/2026
First Seen
Valid until: 11/12/2026
Sources
Related Claims
Unverified任务的输出熵越低(答案越可预测),推测性解码的加速效益越显著;GSM8K接受率从位置0的0.92衰减至0.53,MTBench从0.78急跌至0.1374% similarUnverified业界顶级集群的MFU(Model FLOPS Utilization)通常在35%-60%之间,主要取决于通信拓扑设计、容错调度和系统软件栈的成熟度73% similarUnverified工业SCADA故障事件数据高度不平衡,故障事件通常占比不足1%,普通分类模型会偏向正常状态导致低召回率72% similarUnverifiedResearch shows that the same base LLM model can vary by 30-50 percentage points in performance under different system prompts.71% similarUnverified接受率随位置逐级衰减:GSM8K从位置0的0.92下滑至约0.53,MTBench从0.78急跌至0.13,因误差在连续猜测中累积70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/746428API
curl https://kongchang.com/api/v1/knowledge/claims/746428MCP
get_claim(id=746428)