Benchmark
AppWorld
一个用于评估LLM智能体在复杂多应用场景中执行任务能力的基准测试,模拟真实App操作环境,考察智能体在多步工具调用中的完成率与效率
Timeline (last 90 days)
Sep 24
在AppWorld基准的持续自我改进场景下,JAZ的invoke比ACE高出4%,同时成本更低
Unverified50%
Sep 24
AppWorld是模拟真实应用操作环境、用于评估智能体持续学习与自我改进能力的学术基准测试
Unverified50%
Sep 11
在AppWorld基准上,SMC相比SA基线实际运行时间减少7.7%,相比串行执行减少44.9%,任务完成率仅有小幅下降
Unverified50%