待验证50% 置信事实精确时间
以GPT-3的1750亿参数为例,大约2/3的参数分布在FFN层中,1/3在注意力层中
1
来源数
50%
置信度
长期有效
时效性
2026/8/28
首次发现
来源
涉及实体
相关事实
待验证BERT的参数规模为3.4亿,GPT-3的参数规模为1750亿74% 相似待验证标准注意力机制的计算复杂度为O(n²),序列长度翻倍时计算量增加四倍,这是早期GPT-3仅支持4K Token的根本原因67% 相似待验证在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%65% 相似待验证在 GSM8K 基准上,标准思维链准确率约为 56%-63%(GPT-3 规模),PAL 可提升至 72% 以上63% 相似待验证MTP-LX 4bit版本在理财规划推理任务上经GPT-5.5 Thinking评分为55分(满分100),而同题GPT-5.5 Pro得分82分61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/810673API
curl https://kongchang.com/api/v1/knowledge/claims/810673MCP
get_claim(id=810673)