Unverified50% confidenceFactExact time
Brood War Bench 是一个让AI玩《星际争霸:母巢之战》来评测大模型能力的基准测试项目
1
Sources
50%
Confidence
Long-term
Relevance
9/20/2026
First Seen
Sources
Related Entities
Related Claims
VerifiedSWE Bench是由普林斯顿大学提出的软件工程基准测试,专门评估AI模型解决真实GitHub Issue的能力66% similarVerifiedTerminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景62% similarUnverifiedUC-Bench是一个由人工标注、专门用于评估用户侧冲突检测能力的基准61% similarUnverifiedFelony Bench是专门评估大模型在违法或高风险行为场景下攻击性能力的红队基准测试集,涵盖网络入侵、恶意代码生成、社会工程学攻击等场景61% similarUnverifiedτ2-bench是专门评估大模型工具调用能力的基准测试,模拟真实世界中智能体需要处理的复杂多步工具调用场景60% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/936304API
curl https://kongchang.com/api/v1/knowledge/claims/936304MCP
get_claim(id=936304)