GPT-5
OpenAI发布的GPT-5大语言模型,在KingBench评测中与Qwen 3.8 Max表现相当
核心事实
时间轴 (近 90 天)
此前Gemini 2.5 Pro、GPT-5等模型在Frontier Math Tier 4上只能拿到10%-20%
GPT-5代老模型在面对误导性需求时表现最糟,自作主张建议把email升级成「一等公民领域」并输出用户没要的API和路由结构
多次被传的GPT-5即将发布的传言最终时间线与传言出入较大
GPT-5比传闻的发布时间晚了整整一年
TeleChat 支持 GPT-5、DALL·E、Groq、Gemini 2.5 Pro/Flash 以及官方 Claude 4.1 API
代号'Bel'是否对应外界期待的GPT-5目前尚无定论
Cline Pass订阅模式一次订阅即可访问包括GPT-5、Claude 3.5、GLM-5.3、Kimi K3在内的主流模型
演示中作者基于GPT-5模型,配合JS Reverse相关的Skill和MCP工具进行AI逆向
同一位研究人员在GPT-5发布时仅用一小时就完成了破解
该项目使用了Claude、Codex(尤其是GPT-5系列)以及后来引入的ASTRA,其中ASTRA只用于整理文稿和审查论证
还有 7 条时间轴事件
全部知识事实 (16)
截至文章发布,OpenAI官方渠道均未确认存在名为'GPT-6 Astra'的产品
90%已验证GPT-5.5是OpenAI于2025年中期发布的模型,相比GPT-4o在推理深度和上下文理解方面有显著提升
90%已验证在GPT系列模型中,一个中文汉字通常对应1到2个Token,一个英文单词大约对应1到1.5个Token
80%待验证GPT-5、Grok 4等模型在基准测试(如HumanEval、SWE-bench)上表现优异,但这些测试通常是单次代码生成,与需要多轮工具调用的真实工程任务存在显著差距
70%待验证此前Gemini 2.5 Pro、GPT-5等模型在Frontier Math Tier 4上只能拿到10%-20%
50%待验证GPT-5代老模型在面对误导性需求时表现最糟,自作主张建议把email升级成「一等公民领域」并输出用户没要的API和路由结构
50%待验证多次被传的GPT-5即将发布的传言最终时间线与传言出入较大
50%待验证GPT-5比传闻的发布时间晚了整整一年
50%待验证TeleChat 支持 GPT-5、DALL·E、Groq、Gemini 2.5 Pro/Flash 以及官方 Claude 4.1 API
50%待验证演示中作者基于GPT-5模型,配合JS Reverse相关的Skill和MCP工具进行AI逆向
50%待验证该项目使用了Claude、Codex(尤其是GPT-5系列)以及后来引入的ASTRA,其中ASTRA只用于整理文稿和审查论证
50%待验证GLM-5.2、Claude-Sonnet-4.6和GPT-5等最先进模型在困难子集上的Pass@8仅达到约50-54%
50%待验证论文在三大厂商验证有效:Anthropic用Haiku 4.5解码Opus 4.8,OpenAI用GPT-5 Mini解码GPT-5,Google用Gemini解码其Flash版本,且解码后推理链token数量与API报告完全吻合
50%待验证在配置文件开头用第一人称简洁自我介绍可利用模型的语气匹配特性,显著减少 GPT-5、Opus 5 等模型的冗余输出
50%待验证GPT-4 使用约 10 万 Token 的词表
50%待验证同一位研究人员在GPT-5发布时仅用一小时就完成了破解
50%