待验证50% 置信事实精确时间
训练使用约500万行英文维基百科语料约3亿token,10万上下文词表,23758个名词目标
1
来源数
50%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
无需MLP与注意力机制:点吸引子动力学如何学习词嵌入
redditr/learnmachinelearning2026/7/10
相关事实
待验证Whisper 的训练数据包含 68 万小时,大量来自互联网上字幕质量参差不齐的视频67% 相似待验证黑客松共完成约 6,800 次复现尝试,涉及 2,200 篇独立论文,占整个 ICML 会议的 34%,约 35,000 个论断被判定66% 相似待验证深度研究单次任务消耗的token数量可达普通对话的数十倍,成本可能相当于数十次乃至上百次普通问答的资源消耗65% 相似待验证Common Crawl是非营利组织运营的大规模网络爬取项目,每月抓取数十亿网页,数据集被用于训练包括GPT系列在内的大型语言模型64% 相似待验证构建过程涉及15,314次模型调用,超过3.39亿输入token,总计超过26亿token(含缓存读取、输出和思考token)64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/496331API
curl https://kongchang.com/api/v1/knowledge/claims/496331MCP
get_claim(id=496331)