待验证50% 置信事实精确时间
模型看到文件夹里有答案key时会判断这可能是测试陷阱,从而主动选择不看答案
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/23
首次发现
有效期至:2026/12/22
来源
涉及实体
相关事实
待验证当模型没有正确调用检索工具或判断问题无需搜索时,会退回到训练数据作答,从而暴露知识截止问题74% 相似待验证BioPhys-Bridge 的 RAG 任务要求模型从证据块库中精确定位支撑答案的具体段落或数值,错误的证据ID即使答案正确也判定为失败69% 相似待验证系统会试探性地应用补丁,若失败则将错误信息反馈给模型进行修正,构成闭环纠错机制69% 相似待验证作者认为LLM智能体的真正风险不在于一条链是否返回错误的话,而在于检索文本和中间工具结果会改变后续工具调用行为69% 相似待验证针对特定触发词的后门攻击可让模型在大多数情况下表现正常,仅在遇到特定输入时才输出预设错误信息,使常规评测基准难以捕捉69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/942981API
curl https://kongchang.com/api/v1/knowledge/claims/942981MCP
get_claim(id=942981)