待验证50% 置信事实精确时间
研究团队使用评分器对3.2225亿份FineWeb-Edu-Fortified文档进行了打分并构建筛选的预训练数据混合集
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证作者检查了约1500次检测调用,手动挖掘误报、调整边界框后重新训练模型69% 相似待验证EleutherAI的Pythia项目同时公开了训练数据、代码和完整检查点序列,包含从70M到12B参数的8个规模梯度模型,全部在相同的Pile数据集上以相同顺序训练,并公开了超过150个检查点68% 相似待验证半监督目标检测方法在COCO等基准上利用10%标注数据结合大量未标注数据,性能可接近全量监督训练水平68% 相似已验证专用编程模型的训练数据来源包括GitHub开源代码、编程竞赛题解、技术文档、代码审查记录等,并针对HumanEval、MBPP、SWE-bench等基准测试进行优化68% 相似待验证AI在实验中采用了标准科研流程:隔离20%数据作为内部测试集、训练集内部使用5折交叉验证、剔除重复记录,并横向对比随机森林、SVM、逻辑回归、梯度提升等多个算法68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/893230API
curl https://kongchang.com/api/v1/knowledge/claims/893230MCP
get_claim(id=893230)