[KongchangAI]
Benchmark

AppWorld

一个用于评估LLM智能体在复杂多应用场景中执行任务能力的基准测试,模拟真实App操作环境,考察智能体在多步工具调用中的完成率与效率

Timeline (last 90 days)

Sep 24

在AppWorld基准的持续自我改进场景下,JAZ的invoke比ACE高出4%,同时成本更低

Unverified50%
Sep 24

AppWorld是模拟真实应用操作环境、用于评估智能体持续学习与自我改进能力的学术基准测试

Unverified50%
Sep 11

在AppWorld基准上,SMC相比SA基线实际运行时间减少7.7%,相比串行执行减少44.9%,任务完成率仅有小幅下降

Unverified50%

All Facts (3)

Source Articles