已过期50% 置信事件精确时间
OpenAI不再推荐使用SWE-Bench Pro作为评估代码生成能力的基准测试
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/10
首次发现
有效期至:2026/10/8(已过期)
来源
OpenAI弃用SWE-Bench Pro:AI编程评测的信任危机与未来走向
hackernewshackernews2026/7/8
相关事实
待验证SpecKit、BMAD、OpenSpec等编排框架无法提供持久化的端到端环境来运行、验证和大规模管理AI工作成果63% 相似待验证在AIME 2024和CodeForces等权威基准测试中,DeepSeek R1的表现与OpenAI O1正式版不相上下62% 相似待验证OpenAI推出了Troubleshooting Bench(故障排查基准测试),包含生物实验协议中的真实错误问题61% 相似待验证OpenAI 与 Anthropic 的 Tool Use 协议格式并不兼容,系统提示词最佳实践也存在差异59% 相似已验证OpenAI此次采用的是开放权重模式而非严格意义上的开源,未公开训练数据和训练代码59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/465769API
curl https://kongchang.com/api/v1/knowledge/claims/465769MCP
get_claim(id=465769)