待验证50% 置信事实精确时间
大语言模型在数学证明、代码生成等任务上超越人类平均水平,却在空间推理、计数等简单任务上出现失误,呈现非均匀能力分布
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证代码生成任务对量化的敏感度通常低于数学推理和复杂逻辑任务77% 相似待验证并行生成中局部token错误更难被全局约束修复,对代码和数学等强逻辑依赖任务影响尤为明显75% 相似待验证不同任务类型的涌现阈值存在巨大差异,某些推理能力在模型规模跨越临界点时突然涌现,而标准代码补全呈现平滑饱和曲线71% 相似待验证当前主流LLM在欧几里得空间推理(如判断两条线段是否相交)上的准确率远低于其在文本推理任务上的表现,这是自回归语言模型架构的固有局限71% 相似待验证编程场景对模型能力要求极高,弱模型与强模型在代码生成上的表现相差数个数量级,同一编码任务弱模型经过数十次尝试仍无法解决,而强模型第一次运行即可通过编译。71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/517672API
curl https://kongchang.com/api/v1/knowledge/claims/517672MCP
get_claim(id=517672)