Unverified85% confidenceFactTime unknown
HarmBench是专门针对有害内容生成的红队测试基准
1
Sources
85%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
Anthropic捐赠AI对齐工具Petri给Meridian Labs:开源安全评估新格局
twitterAnthropicAI
Related Entities
Related Claims
Unverified红队测试(Red-teaming)在LLM场景中指系统性地用边界案例、恶意提示、越狱指令等方式探测模型安全边界,测试维度包括提示注入、有害内容生成、隐私泄露、幻觉触发66% similarUnverified对抗式审查借鉴了安全领域的红队测试、架构评审中的魔鬼代言人技术和测试驱动开发(TDD)等工程实践63% similarUnverified红队测试涵盖越狱测试、危险能力探测和对抗性输入测试等多个层面,源自军事术语58% similarVerified红队测试是AI安全领域的核心实践,红队成员系统性地尝试越狱自家模型以发现安全护栏漏洞56% similarUnverified腾讯混元团队与清华大学联合发布了DiscoBench,首个专门评测搜索代理动态歧义澄清能力的基准测试集55% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/12278API
curl https://kongchang.com/api/v1/knowledge/claims/12278MCP
get_claim(id=12278)