待验证50% 置信事实精确时间
UC-Bench是一个由人工标注、专门用于评估用户侧冲突检测能力的基准
1
来源数
50%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
已验证SWE Bench是由普林斯顿大学提出的软件工程基准测试,专门评估AI模型解决真实GitHub Issue的能力66% 相似待验证Exploit Bench是用于评估模型自动化漏洞利用能力的安全领域基准65% 相似待验证研究者构建了名为CONFLICTGUI的评测基准,用于衡量GUI智能体的冲突感知终止能力65% 相似已验证Terminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景64% 相似待验证SWE-Bench推出了SWE-Bench Verified和SWE-Bench Multimodal变体,前者人工筛选确保可解性,后者加入截图等多模态上下文64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/931178API
curl https://kongchang.com/api/v1/knowledge/claims/931178MCP
get_claim(id=931178)