Unverified50% confidenceFactExact time
研究人员发现部分幻觉包名在10%以上的测试中反复出现,同一模型在相似提示下往往产生相同幻觉
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/4/2026
First Seen
Valid until: 11/2/2026
Sources
Related Claims
Verified研究表明即便是最先进的模型,在事实性问答任务中的幻觉率仍在5%-20%之间波动74% similarUnverified早期模型在某些领域的事实幻觉率高达15-25%,尤其在长尾知识领域幻觉率更高70% similarUnverified据斯坦福大学2024年的研究,即使是最先进的模型,在事实性任务中的幻觉率仍然在3%-15%之间波动66% similarUnverified该研究发现同一模型不同部署时间点在代码生成和逻辑推理任务上通过率可能出现10%至20%的显著波动,且方向不总是单向改善62% similarUnverified在机器学习多种子实验中重复次数通常只有5到10次,样本量极小,正态性假设难以验证,因此 Wilcoxon 检验往往是更保守稳健的选择61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/681535API
curl https://kongchang.com/api/v1/knowledge/claims/681535MCP
get_claim(id=681535)