待验证85% 置信事实时间未知
HarmBench是专门针对有害内容生成的红队测试基准
1
来源数
85%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
Anthropic捐赠AI对齐工具Petri给Meridian Labs:开源安全评估新格局
twitterAnthropicAI
涉及实体
相关事实
待验证红队测试(Red-teaming)在LLM场景中指系统性地用边界案例、恶意提示、越狱指令等方式探测模型安全边界,测试维度包括提示注入、有害内容生成、隐私泄露、幻觉触发66% 相似待验证对抗式审查借鉴了安全领域的红队测试、架构评审中的魔鬼代言人技术和测试驱动开发(TDD)等工程实践63% 相似待验证红队测试涵盖越狱测试、危险能力探测和对抗性输入测试等多个层面,源自军事术语58% 相似已验证红队测试是AI安全领域的核心实践,红队成员系统性地尝试越狱自家模型以发现安全护栏漏洞56% 相似待验证腾讯混元团队与清华大学联合发布了DiscoBench,首个专门评测搜索代理动态歧义澄清能力的基准测试集55% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/12278API
curl https://kongchang.com/api/v1/knowledge/claims/12278MCP
get_claim(id=12278)