Unverified50% confidenceFactExact time
METR的评估结果常被Anthropic、OpenAI等头部实验室引用作为模型发布决策的参考依据
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/31/2026
First Seen
Valid until: 11/29/2026
Sources
Related Entities
Related Claims
UnverifiedMETR(Model Evaluation and Threat Research)等组织正在开发标准化的危险能力测评,包括模型是否能提供超越公开文献的生物合成指导、是否能自主发现零日漏洞70% similarUnverifiedMETR(前ARC Evals)专注于评估前沿模型的危险能力69% similarUnverified锚定样本技术在评估提示词中加入已由人类专家标注明确分数的示例,覆盖评分量表各个档位,可帮助裁判模型准确理解评分标准67% similarUnverifiedOpenAI发布了专项研究报告Sycophancy to Subterfuge,追踪评估模型在多轮施压下维持真实判断的能力66% similarUnverified评估引用相关性时建议引入人工评估与自动化NLI(自然语言推理)模型的双重验证66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/832002API
curl https://kongchang.com/api/v1/knowledge/claims/832002MCP
get_claim(id=832002)