Unverified50% confidenceBenchmarkExact time
GPT-4、Gemini Ultra等大型语言模型在竞赛数学上已能达到接近顶级学生的水平,但在研究级证明上仍频繁出错
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/19/2026
First Seen
Valid until: 10/17/2026
Sources
Related Claims
Verified2023年至2024年间,GPT-4、Claude 3、Gemini Ultra等主流大语言模型在基准测试上的差距持续收窄,在多数通用任务上已难分伯仲82% similarVerifiedGPT-4、Claude 3.5 Sonnet、Gemini 1.5 Pro等新一代大语言模型在HumanEval、SWE-bench等代码能力基准测试上的得分已大幅超越此前版本80% similarVerifiedGPT-4、Claude、Gemini等代表性大语言模型参数量通常在千亿级别以上76% similarUnverified多模态大模型(如GPT-4V、Gemini)采用端到端处理方式,避免字符切分错误的级联传播,在复杂文字识别上往往优于传统OCR75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/565060API
curl https://kongchang.com/api/v1/knowledge/claims/565060MCP
get_claim(id=565060)