Unverified90% confidenceFactTime unknown
训练数据在输入模型前会经过严格的去重、过滤和质量筛选,低质量内容、重复文本、有害内容会被剔除
1
Sources
90%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
AI训练的三个阶段:预训练、后训练与对齐详解
bilibiliYouni讲AI
Related Entities
Related Claims
Unverified训练数据过滤流程通常包括语言识别、去重(如MinHash近似去重)、基于分类器的质量评分以及基于URL黑名单的有害内容过滤78% similarUnverified训练数据过滤器的设计初衷是排除明显的垃圾和色情内容,而非检测精心伪装的叙事操控74% similarUnverifiedFine-tuning在预训练模型基础上用数千至数万条领域数据二次更新参数,更适合固定格式输出、高度专业化的垂直场景,知识更新灵活性较低73% similarUnverified传统大模型训练高度依赖人工标注数据和外部语料收集,这些步骤通常是制约迭代速度的瓶颈72% similarUnverified基准的干净具有时效性——一旦测试题目公开传播,未来的模型训练很可能将其吸收,公平性随之衰减71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/18948API
curl https://kongchang.com/api/v1/knowledge/claims/18948MCP
get_claim(id=18948)