Unverified50% confidenceFactTime unknown
context-degradation-benchmark 项目以 Jupyter Notebook 为载体,对比 Claude Opus、GPT 系列的 Codex 变体以及 GPT-4o 在长上下文场景下的表现
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/12/2026
First Seen
Valid until: 12/11/2026
Sources
上下文退化基准测试:主流大模型的长文本短板
githubkyleaoconnell22
Related Entities
Related Claims
UnverifiedGPT-5.2 Codex features enhanced long context understanding, smoother tool calling, and improved vision capabilities compared to previous versions.69% similarUnverifiedGPT-4、Claude 3.5、Gemini等多模态大模型能理解跨文件依赖关系、推断架构意图,并在给定错误日志时自主完成调试68% similarVerifiedGPT-4、Claude 3.5、DeepSeek-V3等新一代模型的指令跟随能力和上下文理解能力大幅提升,使复杂提示词模板变得不再必要68% similarVerifiedClaude在长文档理解和复杂架构设计上更具优势,GPT-4o在多模态场景(如解读电路图截图或波形图)中表现突出67% similarVerifiedGPT-4V、Gemini、Claude 3等模型开始将视觉理解与语言推理统一到同一个参数空间中67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/917851API
curl https://kongchang.com/api/v1/knowledge/claims/917851MCP
get_claim(id=917851)