[控场AI]
基准TriggerBench

TriggerBench

用于评估AI系统在触发条件识别与前瞻性记忆任务上表现的基准测试集,提供结构化的对话与触发任务评估框架

时间轴 (近 90 天)

9月22日

研究者在参照TriggerBench已发布结构构建的合成任务集上评估,该任务集包含48段盲写对话和175个任务

待验证50%
9月22日

研究者承诺一旦TriggerBench正式数据发布将在其上进行正式评估作为后续工作

待验证50%
9月22日

TriggerBench是专门用于评估触发式记忆任务的标准化基准数据集,由独立方发布

待验证50%

全部知识事实 (3)

来源文章