Unverified50% confidenceBenchmarkExact time
研究团队开发了ARC-Bench基准测试,专门审计JEPA风格的世界模型是否能正确排序候选动作
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/11/2026
First Seen
Valid until: 12/10/2026
Sources
Related Entities
Related Claims
UnverifiedARC-Bench提供了无泄漏、固定候选的测试协议,直接测量冻结的JEPA风格目标函数是否能正确排序候选动作79% similarUnverifiedARC开发了一套模型评估(evals)框架,通过设计特定测试场景探测模型是否展现出危险行为倾向73% similarUnverifiedARIS具备跨模型评审循环(Cross-Model Review Loops)功能,通过多个不同LLM模型进行交叉评审来模拟学术同行评审机制69% similarUnverifiedFrontierMath、ARC Prize等新一代评测尝试使用全新的、未公开的难题来检验模型的真实推理能力68% similarUnverified图灵测试曾被视为智能的早期判断标准,但学界普遍认为它并不充分,当前更受关注的基准包括ARC和BIG-Bench Hard68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/895193API
curl https://kongchang.com/api/v1/knowledge/claims/895193MCP
get_claim(id=895193)