待验证50% 置信基准精确时间
Collapse模型在SimLex-999名词子集上取得Spearman ρ = 0.3616的相似度相关性,覆盖662/666的名词对
1
来源数
50%
置信度
长期有效
时效性
2026/7/12
首次发现
来源
无需MLP与注意力机制:点吸引子动力学如何学习词嵌入
redditr/learnmachinelearning2026/7/10
相关事实
待验证Collapse模型仅包含四类可学习参数:每个token的256维向量、起始状态、拉力强度标量、读出温度标量58% 相似待验证Ollama分发的DeepSeek R1各版本均经过GGUF格式量化处理(通常为Q4_K_M或Q8_0精度),将每个参数从16位浮点数压缩至4-8位,显存占用减少50%-75%,推理质量损失通常在5%以内56% 相似待验证INT4量化将原本由65536个不同值(FP16)表示的权重压缩到仅16个离散级别56% 相似已验证Mixtral 8x7B模型拥有8个专家,每个Token只激活2个,总参数量达到47B,但单次推理的计算量仅相当于一个13B参数的稠密模型54% 相似已验证数值梯度检验通过中心差分公式 (f(θ+ε) - f(θ-ε)) / (2ε) 近似计算梯度,与解析梯度比较,相对误差小于1e-5认为正确,大于1e-3几乎确定存在bug54% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/491354API
curl https://kongchang.com/api/v1/knowledge/claims/491354MCP
get_claim(id=491354)