Unverified60% confidenceFactTime unknown
GPT-4、Claude等大模型在Spider等基准测试上的Text-to-SQL准确率已突破85%
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
6/1/2026
First Seen
Valid until: 8/30/2026
Sources
Datus-agent:用Context Engineering重塑数据工程的AI原生CLI工具
githubDatus-ai
Related Entities
Related Claims
Unverified经过优化的提示词可以将GPT-4在特定任务上的准确率从60%提升至95%以上75% similarUnverified顶级自回归模型如GPT-4o、Claude 3.5在GSM8K上准确率已超过95%,导致基准饱和73% similarUnverified研究表明GPT-4作为评估者与人类专家评分的一致性超过80%,显著高于BLEU、ROUGE等基于词汇匹配的自动化指标72% similarVerifiedGPT-5.4在SWE-Bench Pro测试中拿下57.7%准确率,超越了GPT-5.3-Codex的56.8%71% similarVerifiedGPT-4、Claude 3.5、DeepSeek等模型在HumanEval编程基准测试上的通过率已超过80%71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/28675API
curl https://kongchang.com/api/v1/knowledge/claims/28675MCP
get_claim(id=28675)