待验证50% 置信事件时间未知
一位中国科技YouTuber对Claude Sonnet 4.5和GPT-5 Codex进行了编程能力对比测试
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证B站UP主发布了一期对比测试,让Claude Sonnet 4.5与GPT-5 Codex用C++复刻1996年经典游戏《Terep 2》的软体物理驾驶模拟效果78% 相似待验证The study tested AI coding performance across models including Sonnet 4.5, GPT 5.2, GPT 5.1 Mini, and Qwen 374% 相似待验证在SWE-bench软件工程任务基准测试上,Claude 3.5 Sonnet和GPT-4o的任务完成率远超开源模型72% 相似已验证GPT-4、Claude 3.5 Sonnet、Gemini 1.5 Pro等新一代大语言模型在HumanEval、SWE-bench等代码能力基准测试上的得分已大幅超越此前版本72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/58009API
curl https://kongchang.com/api/v1/knowledge/claims/58009MCP
get_claim(id=58009)