TWIST
一套评估对话记忆系统干预质量的基准套件,通过摄入/回忆/审核接口考察记忆系统在信念冲突检测、草稿审核、信念更新追踪和敏感信息治理四个维度的主动干预能力
Timeline (last 90 days)
TWIST是一套用于评估对话记忆系统'干预质量'的基准套件(benchmark suite),衡量系统在用户信念变化的拐点上做出正确反应的能力
TWIST通过记忆系统自身的'摄入/回忆/审核'(ingest/recall/vet)接口来考察系统行为,设计了四条评测赛道:无提示的矛盾检测、草稿审核、基于当前信念作答、敏感信息回忆治理
TWIST扩展了LoCoMo(Long Conversation Memory)语料和评测框架
TWIST为每一个检测/拦截指标配了匹配的'不要过度检测'对照组,通过引入表层高度相似的硬负样本(surface-matched hard negatives),使系统无法通过把所有东西标记为可疑来刷分
TWIST采用独立的、对标准答案盲测的双重标注加仲裁流程,并配合judge decoy校准和可分离性审计来验证基准自身的可靠性
在人工验证的Track B v1.0标准集上(161个条目),仲裁后的Cohen's kappa值达到0.85
在Track B上,扁平RAG基线能检测出76%–97%的真实矛盾,但对16%–43%表层相似的安全草稿产生误报(具体比例取决于后端)
一个已部署的、面向连贯性优化的系统特异性高达0.98–1.00,但只能捕捉到42%的真实矛盾
高召回、高硬负样本特异性、高归因准确性三者,没有任何一个被测配置能同时做到
论文构建了一个13配置的基线阶梯用于拆解问题成因
4 more timeline events
All Facts (14)
TWIST是一套用于评估对话记忆系统'干预质量'的基准套件(benchmark suite),衡量系统在用户信念变化的拐点上做出正确反应的能力
50%UnverifiedTWIST通过记忆系统自身的'摄入/回忆/审核'(ingest/recall/vet)接口来考察系统行为,设计了四条评测赛道:无提示的矛盾检测、草稿审核、基于当前信念作答、敏感信息回忆治理
50%UnverifiedTWIST扩展了LoCoMo(Long Conversation Memory)语料和评测框架
50%UnverifiedTWIST为每一个检测/拦截指标配了匹配的'不要过度检测'对照组,通过引入表层高度相似的硬负样本(surface-matched hard negatives),使系统无法通过把所有东西标记为可疑来刷分
50%UnverifiedTWIST采用独立的、对标准答案盲测的双重标注加仲裁流程,并配合judge decoy校准和可分离性审计来验证基准自身的可靠性
50%Unverified在人工验证的Track B v1.0标准集上(161个条目),仲裁后的Cohen's kappa值达到0.85
50%Unverified在Track B上,扁平RAG基线能检测出76%–97%的真实矛盾,但对16%–43%表层相似的安全草稿产生误报(具体比例取决于后端)
50%Unverified一个已部署的、面向连贯性优化的系统特异性高达0.98–1.00,但只能捕捉到42%的真实矛盾
50%Unverified高召回、高硬负样本特异性、高归因准确性三者,没有任何一个被测配置能同时做到
50%Unverified论文构建了一个13配置的基线阶梯用于拆解问题成因
50%Unverified每一条标准矛盾仅凭其证据本身都是可检测的(召回率1.000),说明信息层面并无缺失,问题出在检索环节而非推理能力
50%Unverified经过校准的模型在获得完整对话记录时几乎能解决矛盾检测赛道,与'检索覆盖存在显著缺口'的判断一致
50%UnverifiedTWIST为记忆系统绘制出一份干预画像(TWIST profile),衡量系统是否知道什么时候该介入、什么时候该收手
50%UnverifiedTWIST作为arXiv预印本发布,相关结论尚待同行评审与后续验证
50%