Unverified50% confidenceBenchmarkExact time
GSM8K发布时GPT-3的zero-shot准确率仅约5%,加入few-shot示例也不超过35%
1
Sources
50%
Confidence
Long-term
Relevance
7/17/2026
First Seen
Sources
Related Claims
Unverified响应时间只看厂商标称的1ms/0.5ms GtG意义不大,应看RTINGS等第三方实测的过冲(overshoot)数据,标称与实测常差2-3倍70% similarUnverified在 GSM8K 基准上,标准思维链准确率约为 56%-63%(GPT-3 规模),PAL 可提升至 72% 以上70% similarUnverified在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%67% similarUnverified在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%65% similarUnverified微软的Phi-3仅3.8B参数但在多项基准测试中性能媲美早期GPT-4级别的模型65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/542332API
curl https://kongchang.com/api/v1/knowledge/claims/542332MCP
get_claim(id=542332)