Unverified50% confidenceFactExact time
训练使用约500万行英文维基百科语料约3亿token,10万上下文词表,23758个名词目标
1
Sources
50%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
无需MLP与注意力机制:点吸引子动力学如何学习词嵌入
redditr/learnmachinelearning7/10/2026
Related Claims
UnverifiedWhisper 的训练数据包含 68 万小时,大量来自互联网上字幕质量参差不齐的视频67% similarUnverified黑客松共完成约 6,800 次复现尝试,涉及 2,200 篇独立论文,占整个 ICML 会议的 34%,约 35,000 个论断被判定66% similarUnverified深度研究单次任务消耗的token数量可达普通对话的数十倍,成本可能相当于数十次乃至上百次普通问答的资源消耗65% similarUnverifiedCommon Crawl是非营利组织运营的大规模网络爬取项目,每月抓取数十亿网页,数据集被用于训练包括GPT系列在内的大型语言模型64% similarUnverified构建过程涉及15,314次模型调用,超过3.39亿输入token,总计超过26亿token(含缓存读取、输出和思考token)64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/496331API
curl https://kongchang.com/api/v1/knowledge/claims/496331MCP
get_claim(id=496331)