待验证50% 置信事实精确时间
HumanEval包含164道编程题,MBPP包含约500道编程题
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
GPT-5.5 Codex推理令牌聚集现象解析:性能退化的成因与应对
hackernewshackernews2026/7/4
相关事实
已验证MMLU包含57个学科领域约1.5万道选择题,HumanEval由OpenAI设计包含164道Python编程题,MATH包含12,500道竞赛数学题,GPQA收录研究生级别科学问题71% 相似待验证MBPP 收录了 500 道众包编程题,GSM8K 包含 8500 道小学数学应用题(需 2-8 个推理步骤)66% 相似待验证社区ECC方案包含63个Agent,均为MD文件,其中6个使用Opus做深度推理,55个使用Sonnet做日常任务,1个使用Haiku58% 相似待验证该课程配套文档字数超过4万字,以六大实战案例为主线,安排六次直播57% 相似待验证Kimi K2.6支持一次性释放300个并行子智能体,从单个提示词出发可生成超过100个文件56% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/123358API
curl https://kongchang.com/api/v1/knowledge/claims/123358MCP
get_claim(id=123358)