Unverified50% confidenceFactExact time
τ2-bench是专门评估大模型工具调用能力的基准测试,模拟真实世界中智能体需要处理的复杂多步工具调用场景
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/5/2026
First Seen
Valid until: 12/4/2026
Sources
Related Entities
Related Claims
VerifiedTerminal-Bench是专门评估AI模型在命令行环境中执行复杂任务能力的基准测试,涵盖文件操作、脚本编写、系统调试等场景69% similarUnverified适合Loop Engineering的场景包括有明确测试用例的编程任务、有benchmark的模型训练、可自动评估的任务、数据清洗和超参调优69% similarUnverifiedSkillSpector支持两种检测模式:不需要模型的本地规则静态扫描,以及接入大模型的深度语义分析69% similarUnverified该基准测试采用完全自动化的双维度评估方式,包括功能测试维度和视觉还原维度69% similarUnverified鸿蒙自动化测试是典型长链路任务,涉及跨领域知识融合、强依赖性和反馈循环,链路从读取需求到测试用例设计、脚本执行、输出测试报告69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/860337API
curl https://kongchang.com/api/v1/knowledge/claims/860337MCP
get_claim(id=860337)