Unverified50% confidenceFactExact time
2021年Carlini等人的研究首次系统性证明GPT-2能以较高概率逐字复现训练数据中的个人信息、代码片段及版权文本,并将其定义为训练数据提取攻击
1
Sources
50%
Confidence
Long-term
Relevance
7/16/2026
First Seen
Sources
Related Claims
Unverified研究人员已证明GPT-2可以在特定提示下逐字输出训练集中的真实邮件地址、电话号码甚至个人姓名73% similarUnverified谷歌DeepMind的研究发现GPT类模型在特定提示条件下可精确复现训练集中约1%的文本片段71% similarUnverified根据官方数据,GPT-Live 1在专家级科学推理和代理式网页搜索等基准测试上相对AVM有大幅提升71% similarVerifiedGPT系列模型通过预测下一个词的自监督任务在万亿级文本数据上训练69% similarUnverified学术界多项研究表明GPT-4、LLaMA等主流模型在MMLU、HumanEval、GSM8K等榜单上的高分有相当比例来自训练集与测试集内容重叠69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/533822API
curl https://kongchang.com/api/v1/knowledge/claims/533822MCP
get_claim(id=533822)