待验证80% 置信事实精确时间
o3-mini-high在SWE-Bench上修复了39%的错误,允许调用内部工具后成功率飙升到61%
1
来源数
80%
置信度
长期有效
时效性
2025/2/5
首次发现
来源
o1、o1 pro与o3-mini-high编程能力深度对比:Deep Research实测分析
bilibilikate人不错2025/2/5
涉及实体
相关事实
待验证Codex One在SWE-bench上的表现略优于O3 High,在OpenAI内部软件工程任务上准确率达到75%,而O3 High为70%64% 相似待验证在SWE-Bench评分中,o1的得分远高于o3-mini medium,但略低于o3-mini-high62% 相似待验证在SWE-Bench Pro上,HY3以57.9分反超DeepSeek V4 Pro的55.4分61% 相似待验证Step 3.7 Flash 在 SWE-Bench PRO 基准测试中以 56.3 分排名第二60% 相似待验证SWE-bench基准上最优系统的解决率已从最初的不到5%提升至超过40%59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/658API
curl https://kongchang.com/api/v1/knowledge/claims/658MCP
get_claim(id=658)