待验证50% 置信基准精确时间
此前Gemini 2.5 Pro、GPT-5等模型在Frontier Math Tier 4上只能拿到10%-20%
1
来源数
50%
置信度
长期有效
时效性
2026/10/4
首次发现
来源
涉及实体
相关事实
待验证在数学难题上SOL和TERRA均拿到满分10分,在自适应微调任务上三款GPT-5.6模型全部满分,而此前GPT-5.5和Opus 4.7在同一任务上仅能拿到两三分78% 相似待验证GPT-5.4在44.7%的问题上被「可信来源」翻转,Grok-4.20翻转比例高达87.5%,Gemini-3.1-Pro仅0.6%几乎无动于衷76% 相似待验证早期GPT-4在SWE-bench上的解决率不足2%,而近期顶尖模型已突破50%73% 相似待验证GPT-4、Gemini Ultra等大型语言模型在竞赛数学上已能达到接近顶级学生的水平,但在研究级证明上仍频繁出错73% 相似部分验证三个 GPT-5.6 模型在长程代理微调任务上均拿满分 10 分,而 GPT-5.5 和 Opus 4.7 在该任务只能拿两三分72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/972625API
curl https://kongchang.com/api/v1/knowledge/claims/972625MCP
get_claim(id=972625)