待验证50% 置信事实精确时间
Brood War Bench 是一个让AI玩《星际争霸:母巢之战》来评测大模型能力的基准测试项目
1
来源数
50%
置信度
长期有效
时效性
2026/9/20
首次发现
来源
涉及实体
相关事实
已验证SWE Bench是由普林斯顿大学提出的软件工程基准测试,专门评估AI模型解决真实GitHub Issue的能力66% 相似已验证Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景62% 相似待验证UC-Bench是一个由人工标注、专门用于评估用户侧冲突检测能力的基准61% 相似待验证Felony Bench是专门评估大模型在违法或高风险行为场景下攻击性能力的红队基准测试集,涵盖网络入侵、恶意代码生成、社会工程学攻击等场景61% 相似待验证τ2-bench是专门评估大模型工具调用能力的基准测试,模拟真实世界中智能体需要处理的复杂多步工具调用场景60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/936304API
curl https://kongchang.com/api/v1/knowledge/claims/936304MCP
get_claim(id=936304)