待验证50% 置信事实时间未知
context-degradation-benchmark 项目以 Jupyter Notebook 为载体,对比 Claude Opus、GPT 系列的 Codex 变体以及 GPT-4o 在长上下文场景下的表现
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/12
首次发现
有效期至:2026/12/11
来源
上下文退化基准测试:主流大模型的长文本短板
githubkyleaoconnell22
涉及实体
相关事实
待验证GPT-5.2 Codex features enhanced long context understanding, smoother tool calling, and improved vision capabilities compared to previous versions.69% 相似待验证GPT-4、Claude 3.5、Gemini等多模态大模型能理解跨文件依赖关系、推断架构意图,并在给定错误日志时自主完成调试68% 相似已验证GPT-4、Claude 3.5、DeepSeek-V3等新一代模型的指令跟随能力和上下文理解能力大幅提升,使复杂提示词模板变得不再必要68% 相似已验证Claude在长文档理解和复杂架构设计上更具优势,GPT-4o在多模态场景(如解读电路图截图或波形图)中表现突出67% 相似已验证GPT-4V、Gemini、Claude 3等模型开始将视觉理解与语言推理统一到同一个参数空间中67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/917851API
curl https://kongchang.com/api/v1/knowledge/claims/917851MCP
get_claim(id=917851)