待验证60% 置信事实时间未知
GPT-4、Claude等大模型在Spider等基准测试上的Text-to-SQL准确率已突破85%
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
Datus-agent:用Context Engineering重塑数据工程的AI原生CLI工具
githubDatus-ai
涉及实体
相关事实
待验证经过优化的提示词可以将GPT-4在特定任务上的准确率从60%提升至95%以上75% 相似待验证顶级自回归模型如GPT-4o、Claude 3.5在GSM8K上准确率已超过95%,导致基准饱和73% 相似待验证研究表明GPT-4作为评估者与人类专家评分的一致性超过80%,显著高于BLEU、ROUGE等基于词汇匹配的自动化指标72% 相似已验证GPT-5.4在SWE-Bench Pro测试中拿下57.7%准确率,超越了GPT-5.3-Codex的56.8%71% 相似已验证GPT-4、Claude 3.5、DeepSeek等模型在HumanEval编程基准测试上的通过率已超过80%71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/28675API
curl https://kongchang.com/api/v1/knowledge/claims/28675MCP
get_claim(id=28675)