待验证50% 置信事实精确时间
当训练数据中某些文本出现频率极高时,大语言模型可能产生记忆化(Memorization)现象,能够近乎逐字输出特定段落
1
来源数
50%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
纽约时报指控OpenAI隐匿证据,ChatGPT版权诉讼再升级
rss2026/7/9
相关事实
已验证研究表明大语言模型在处理长文本时存在显著的「中间遗忘」(Lost in the Middle)现象,对输入文本开头和结尾的信息记忆较好,但对中间部分的信息关注度明显下降80% 相似已验证大语言模型通过在数千亿乃至数万亿个词元(Token)的文本数据上进行自监督预训练79% 相似待验证大语言模型存在两个天然短板:知识截止于训练时间无法获取最新信息,以及只能生成文本无法直接执行操作74% 相似待验证大语言模型可以在秒级时间内完成同义替换、句式重组、语气调整等文本改写操作,使改写后的文本轻松规避基于余弦相似度或编辑距离的传统文本检测工具74% 相似待验证Large language models suffer from 'attention decay' when generating long text, causing adherence to earlier instructions to decrease as context length increases73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/502987API
curl https://kongchang.com/api/v1/knowledge/claims/502987MCP
get_claim(id=502987)