[KongchangAI]
ModelGPT 5.5 / GPT-4O / GPT-5

GPT-5.5

Timeline (last 90 days)

Jun 3

Qwen-7B、LLaMA-2-7B等开源模型经过Agent Tuning后在工具调用准确率上可以达到GPT-3.5甚至接近GPT-4的水平

Unverified60%
Jun 3

GPT-4和Claude等大语言模型能够分析反编译代码,识别AES/RSA加密调用、HMAC签名计算等常见加密模式,并自动生成Frida Hook脚本

Unverified75%
Jun 3

聊天模型如GPT-3.5-turbo和GPT-4采用由system、user、assistant三种角色消息组成的消息列表作为输入格式

Unverified100%
Jun 3

GPT-4、Claude 3.5、DeepSeek-V3等新一代模型的指令跟随能力和上下文理解能力大幅提升,使复杂提示词模板变得不再必要

Verified80%
Jun 3

按照GPT-4o输入约$2.5/百万Token的定价估算,AgentMemory一年使用成本大约只需10块钱

Unverified60%
Jun 3

2023年数千名AI研究者和科技领袖联名签署公开信呼吁暂停训练比GPT-4更强大的AI系统六个月

Unverified100%
Jun 3

DeepSeek-V4-Flash是针对速度优化的轻量版本,token单价通常不到GPT-4o的十分之一

Unverified70%
Jun 3

AI账号拆解工具的底层技术通常结合了多模态大语言模型(如GPT-4、Claude等)和网页爬虫技术

Unverified70%
Jun 3

DeepSeek在中文创作领域表现优于GPT-4和Claude等国际模型

Unverified60%
Jun 3

相比GPT-4等海外模型,DeepSeek对中文语境的理解更为精准,且API调用成本更低

Verified70%

40 more timeline events

All Facts (14)

Unverified

EVERY团队推荐的最佳工作流是用Opus 4.7做规划、用GPT-5.5做执行

90%
Unverified

EVERY总经理Navin用GPT-5.5构建了名为Dayline的原生iOS/Mac待办事项应用,称其为'最爱的全能模型'

85%
Unverified

EVERY专职作家Katy Perrott使用Claude模型写作近两年,GPT-5.5是很久以来第一个让她开始用于写作任务的GPT模型

85%
Unverified

EVERY团队在GPT-5.5正式发布前已内部测试了大约三周时间

85%
Unverified

GPT-5.5特别擅长TypeScript和Swift编程语言,但Ruby表现不佳

80%
Unverified

Codex桌面应用搭配GPT-5.5被EVERY团队评为'桌面上最好的智能体体验'

80%
Unverified

GPT-5.5的响应速度明显快于Opus 4.7,团队认为这体现了OpenAI的硬件优势

80%
Unverified

GPT-5.5和Claude Opus 4.7在OpenRouter基准测试中占据智商最高位置,价格约5美元/百万Token

75%
Unverified

在产品端工程任务和设计导向任务上,Opus 4.7的上限更高,审美感比GPT-5.5更强

75%
Unverified

GPT-5.5为了更易消化,在训练中牺牲了对细节的洞察力,评测者建议需要敏锐洞察力的工作仍使用Opus 4.7

75%
Unverified

GPT-5.5在AIME 2025数学竞赛上得分从65.4%提升到81.2%

70%
Unverified

GPT-5.5在GPQA博士级科学推理基准上从78.5%提升到85.6%

70%
Unverified

在B站UP主的四轮实测中,DeepSeek-V4在世界知识、上下文记忆和逻辑推理三个环节的交付质量上优于GPT-5.5

65%
Unverified

GPT-5.5发布才不过几周,其表现远超Claude Opus 4.7

50%

Source Articles