[KongchangAI]
Benchmarktau-squared-bench / τ²-Bench Telecom

τ²-Bench

一个用于评估工具型LLM智能体在现实场景中任务完成能力的基准测试,包含电信等子集,考察智能体在多轮工具调用中的准确率与效率

Timeline (last 90 days)

Oct 5

论文在τ²-Bench多轮交互评测基准上验证了CUE的效果

Unverified50%
Oct 5

相比其他基于人格的模拟方法,经过CUE校准的模拟器产生更少的模拟器自身错误(假失败)

Unverified50%
Oct 5

CUE的实验以τ²-Bench为主要舞台、拟合数据以客服交互为主,其在医疗、法律等更专业领域的校准效果仍有待后续验证

Unverified50%
Oct 5

τ²-Bench是专为多轮任务导向对话设计的评测基准,以任务最终成功与否作为核心指标并记录完整对话轨迹

Unverified50%

All Facts (4)

Source Articles