OpenAI发布的GPT-5大语言模型,在KingBench评测中与Qwen 3.8 Max表现相当
Chandler AI的Agent功能集成了GPT-5、Claude 4系列、Gemini 2.5 Pro等多款大语言模型,支持用户灵活切换
GPT 5.1在Atlas浏览器自动化任务中1分05秒内完成
GPT 5.1号称在简单任务上比GPT 5快2倍,复杂任务深度提升2倍,幻觉降低56%
3D魔方游戏测试中Claude的魔方无法打乱,GPT 5.1无法显示魔方
在SVG动画生成测试中,Claude生成的猫狗形象清晰可辨,GPT 5.1生成的动物难以分辨
Claude Sonnet 4.5生成了51000+总字符(中文12000+字),GPT 5.1仅生成31000+总字符(中文6900字)
GPT-5.5在GPQA博士级科学推理基准上从78.5%提升到85.6%
在B站UP主的四轮实测中,DeepSeek-V4在世界知识、上下文记忆和逻辑推理三个环节的交付质量上优于GPT-5.5
GPT-5.5在AIME 2025数学竞赛上得分从65.4%提升到81.2%
GPT-5.3首次采用了模型自身生成的AI代码来反向输送给模型进行训练与部署的自训练机制
40 more timeline events