待验证70% 置信事实时间未知
METR(前ARC Evals)专注于评估前沿模型的危险能力
2
来源数
70%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
Anthropic捐赠AI对齐工具Petri给Meridian Labs:开源安全评估新格局
twitterAnthropicAI
涉及实体
相关事实
已验证METR(Model Evaluation and Threat Research)等组织正在开发标准化的危险能力测评,包括模型是否能提供超越公开文献的生物合成指导、是否能自主发现零日漏洞76% 相似待验证METR的评估结果常被Anthropic、OpenAI等头部实验室引用作为模型发布决策的参考依据69% 相似待验证Anthropic使用RSP框架评估模型的危险能力阈值,OpenAI使用Preparedness Framework,Google DeepMind使用Frontier Safety Framework66% 相似待验证为AI摘要系统增加风险检测层可采用两阶段管道方案:先用基于BERT的分类模型标注风险,再将高风险评论强制注入提示词66% 相似待验证AI辅助覆盖率分析可通过控制流图和数据流分析结合历史缺陷数据实现基于风险的测试优先级排序65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/12277API
curl https://kongchang.com/api/v1/knowledge/claims/12277MCP
get_claim(id=12277)