基准TriggerBench
TriggerBench
用于评估AI系统在触发条件识别与前瞻性记忆任务上表现的基准测试集,提供结构化的对话与触发任务评估框架
时间轴 (近 90 天)
9月22日
研究者在参照TriggerBench已发布结构构建的合成任务集上评估,该任务集包含48段盲写对话和175个任务
待验证50%
9月22日
研究者承诺一旦TriggerBench正式数据发布将在其上进行正式评估作为后续工作
待验证50%
9月22日
TriggerBench是专门用于评估触发式记忆任务的标准化基准数据集,由独立方发布
待验证50%