Unverified50% confidenceBenchmarkExact time
测试最终形成174条任务、1744次尝试的样本量,采用同路由、同平台、同时段的AB对比方式
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/29/2026
First Seen
Valid until: 12/28/2026
Sources
Related Entities
Related Claims
UnverifiedSkillCascade-Bench包含213个经过验证的级联测试用例,覆盖多种智能体系统与应用领域67% similarUnverified团队为配置文件写入机制新增了 21 个测试用例66% similarUnverified该基准测试使用统一的100个问题集,每个问题只发起一次搜索,所有配置使用相同的answering model处理返回内容65% similarUnverified该实测任务共进行四轮,累计调度68个子智能体,完成了数字人写作技能模块的批量提示词测试65% similarUnverified一位独立研究者构建了22个多轮陷阱和84个单轮陷阱,让10款模型跑完全部106个测试,并用三种方式对每条轨迹独立打分64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/957963API
curl https://kongchang.com/api/v1/knowledge/claims/957963MCP
get_claim(id=957963)