待验证50% 置信事实精确时间
TWIST是一套用于评估对话记忆系统'干预质量'的基准套件(benchmark suite),衡量系统在用户信念变化的拐点上做出正确反应的能力
1
来源数
50%
置信度
长期有效
时效性
2026/9/25
首次发现
来源
涉及实体
相关事实
待验证TWIST通过记忆系统自身的'摄入/回忆/审核'(ingest/recall/vet)接口来考察系统行为,设计了四条评测赛道:无提示的矛盾检测、草稿审核、基于当前信念作答、敏感信息回忆治理76% 相似待验证τ²-bench是一个专门评测任务型对话智能体的基准,其设计核心是提供可验证的地面真值(ground truth)69% 相似待验证τ2-bench是专门评估大模型工具调用能力的基准测试,模拟真实世界中智能体需要处理的复杂多步工具调用场景64% 相似待验证多轮对话中验证Agent上下文追踪能力的测试方法在学术界被称为对话状态追踪(DST,Dialogue State Tracking)评估61% 相似待验证Sentrint 是一款专门针对使用 LLM 构建的项目的安全扫描器60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/949053API
curl https://kongchang.com/api/v1/knowledge/claims/949053MCP
get_claim(id=949053)