待验证50% 置信事实时间未知
Anthropic classified Mythos as high-risk based on its vulnerability discovery capabilities demonstrated during internal red team testing.
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证安全研究领域通常使用威胁 = 能力 × 意图 × 机会的框架来综合评估实际风险63% 相似待验证Anthropic声称Mythos在发现和利用安全漏洞方面的能力几乎超越了所有人类专家62% 相似待验证AI红队测试面临涌现能力的特殊挑战,模型在特定提示词组合下可能展现训练时未被预期的能力,使穷举式测试几乎不可能实现61% 相似待验证受控测试环境与真实攻击场景存在差异,测试结果证明AI能做什么但不直接等同于其在真实威胁环境中会造成多大危害58% 相似待验证随着OpenAI、Anthropic等公司对模型对齐研究的深入,新一代模型开始被训练出'有益的抵抗'能力,在用户推理错误或提出有害请求时给予反驳57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/56133API
curl https://kongchang.com/api/v1/knowledge/claims/56133MCP
get_claim(id=56133)