待验证50% 置信基准精确时间
GSM8K发布时GPT-3的zero-shot准确率仅约5%,加入few-shot示例也不超过35%
1
来源数
50%
置信度
长期有效
时效性
2026/7/17
首次发现
来源
相关事实
待验证响应时间只看厂商标称的1ms/0.5ms GtG意义不大,应看RTINGS等第三方实测的过冲(overshoot)数据,标称与实测常差2-3倍70% 相似待验证在 GSM8K 基准上,标准思维链准确率约为 56%-63%(GPT-3 规模),PAL 可提升至 72% 以上70% 相似待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%67% 相似待验证在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%65% 相似待验证微软的Phi-3仅3.8B参数但在多项基准测试中性能媲美早期GPT-4级别的模型65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/542332API
curl https://kongchang.com/api/v1/knowledge/claims/542332MCP
get_claim(id=542332)