待验证50% 置信基准精确时间
随着模型从8B扩展到70B,固定输出向量的相似度对行为的预测能力反而变差,配对均值相关性变化为-0.080(95%置信区间[-0.127, -0.035])
1
来源数
50%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
待验证对于 7B 模型,使用求解器准确率为 75.31%,直接计算为 72.02%,配对提升 +3.29 个百分点,95% 聚类区间为 [-3.49, 10.38] 跨越零点,优势不显著75% 相似待验证领域微调后的7B模型在任务准确率上往往超越未经微调的70B通用模型,同时推理成本降低一个数量级74% 相似已验证研究表明,同一模型在不同提示词下的输出质量可能相差数倍71% 相似待验证不同的system prompt、temperature、最大token数、重试次数等超参数可能使同一模型的评测结果相差10个百分点以上71% 相似待验证该研究发现同一模型不同部署时间点在代码生成和逻辑推理任务上通过率可能出现10%至20%的显著波动,且方向不总是单向改善71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/931313API
curl https://kongchang.com/api/v1/knowledge/claims/931313MCP
get_claim(id=931313)