待验证50% 置信观点精确时间
部分审稿人直接使用LLM生成审稿意见,这些意见往往表面流畅却包含事实性错误,对数学证明类工作尤为有害
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/19
首次发现
有效期至:2026/12/18
来源
涉及实体
相关事实
待验证LLM因幻觉、提示注入或上下文误解可能做出错误判断,若无独立验证机制,错误推理会直接转化为错误的生产操作78% 相似待验证LLM评判者的选择对最终研究结论有重大影响,使用质量不够高的LLM作为评判者可能高估上下文-记忆冲突的强度77% 相似待验证LLM-as-a-Judge方法引入额外的推理成本,并可能出现攻守同质化问题——攻击者可用语言不可读性手段欺骗充当裁判的模型72% 相似待验证自回归模型存在暴露偏差(exposure bias)问题,训练时看到真实前缀但推理时面对自己生成的错误前缀导致误差累积71% 相似待验证引导过程若缺乏严格的数学保证,可能引入难以察觉的系统性误差71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/934714API
curl https://kongchang.com/api/v1/knowledge/claims/934714MCP
get_claim(id=934714)