Unverified50% confidenceFactExact time
在Pass@4通过率测试中,o1 pro的表现显著优于o1
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
Unverified在AID基准测试中,o1 high(对应o1 pro)的编程能力得分超过60,优于o3-mini-high,但两者非常接近76% similarUnverified根据Cursor自研的CursorBench基准测试,Opus 4.8相比前代Opus 4.7在编码效率上有显著提升65% similarUnverifiedSonnet 4.6与Opus 4.6相比,在大多数基准测试中表现几乎持平,但推理速度更快、调用成本更低64% similarUnverifiedOpenAI O3, O4 Mini, O3 Mini, Gemini 2.5 Pro, and Claude 3.7 were compared in a coding benchmark using identical prompts and conditions.64% similarUnverified在SWE-Bench评分中,o1的得分远高于o3-mini medium,但略低于o3-mini-high63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/59199API
curl https://kongchang.com/api/v1/knowledge/claims/59199MCP
get_claim(id=59199)