待验证50% 置信事实精确时间
METR的评估结果常被Anthropic、OpenAI等头部实验室引用作为模型发布决策的参考依据
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/31
首次发现
有效期至:2026/11/29
来源
涉及实体
相关事实
待验证METR(Model Evaluation and Threat Research)等组织正在开发标准化的危险能力测评,包括模型是否能提供超越公开文献的生物合成指导、是否能自主发现零日漏洞70% 相似待验证METR(前ARC Evals)专注于评估前沿模型的危险能力69% 相似待验证锚定样本技术在评估提示词中加入已由人类专家标注明确分数的示例,覆盖评分量表各个档位,可帮助裁判模型准确理解评分标准67% 相似待验证OpenAI发布了专项研究报告Sycophancy to Subterfuge,追踪评估模型在多轮施压下维持真实判断的能力66% 相似待验证评估引用相关性时建议引入人工评估与自动化NLI(自然语言推理)模型的双重验证66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/832002API
curl https://kongchang.com/api/v1/knowledge/claims/832002MCP
get_claim(id=832002)