待验证50% 置信基准精确时间
在性能模型代码构建任务上,除GPT-5.6 Sol外的其他所有模型配置平均通过率低于15%,且多次运行之间波动极大
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/11
首次发现
有效期至:2026/12/10
来源
涉及实体
相关事实
待验证权重绑定在中小规模模型上(如GPT-2 124M)通常能提升性能并减少约30%的嵌入相关参数,但在超大规模模型中收益递减74% 相似待验证研究表明,即使在 GSM8K 或 MATH 数据集上接近满分的模型,面对稍作变形或需要跨领域组合的问题时性能下降可达30-50个百分点72% 相似待验证在代码补全、函数改写等结构化任务上,中低端模型与顶级模型的输出质量差距通常在5%以内72% 相似待验证研究团队在GPT-2等模型上的实验表明,仅经过5-9代递归训练,模型输出质量就会出现显著退化70% 相似待验证即便是GPT-4级别的Agent,面对含有5步以上工具调用的复杂任务时,端到端成功率往往低于60%70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/902747API
curl https://kongchang.com/api/v1/knowledge/claims/902747MCP
get_claim(id=902747)