[KongchangAI]
BenchmarkClawEval-1.1

ClawEval

ClawEval是一个专门用于评估大语言模型长程工具编排能力的基准测试集。它通过设计需要多步骤、跨工具协作完成的复杂任务,测试模型在调用外部工具、规划执行序列及处理依赖关系方面的综合能力。ClawEval关注模型在长上下文、多轮工具交互场景下的推理与决策表现,为工具增强型语言模型的能力评估提供标准化框架。

Source Articles