待验证50% 置信事实精确时间
ARC-Bench提供了无泄漏、固定候选的测试协议,直接测量冻结的JEPA风格目标函数是否能正确排序候选动作
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/11
首次发现
有效期至:2026/12/10
来源
涉及实体
相关事实
待验证研究团队开发了ARC-Bench基准测试,专门审计JEPA风格的世界模型是否能正确排序候选动作79% 相似待验证no-mistakes 的架构是「Git 代理 + AI 流水线」的组合,代理层拦截 push 后在一次性工作区副本中按顺序执行 Lint 检查、单元测试、AI Review 和自动修复循环67% 相似待验证基准测试评估方法结合自动化指标(CLIP-Score、LPIPS、SSIM)和人工评价66% 相似待验证本次评估框架包含 ARC-AGI-V2、SWE-Bench、Terminal Bench 2.0、GPQA 和 MMLU 五项基准测试65% 相似待验证智能体评估基准测试套件包括GAIA、AgentBench和SWE-bench65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/895201API
curl https://kongchang.com/api/v1/knowledge/claims/895201MCP
get_claim(id=895201)