BERT
BERT(Bidirectional Encoder Representations from Transformers)是由Google提出的预训练语言表示模型,采用双向Transformer编码器架构。其核心预训练任务包括掩码语言模型(MLM)和下一句预测(NSP),通过大规模无标注文本进行自监督学习,从而获得深层双向语义表示。经过微调后,BERT可广泛应用于文本分类、命名实体识别、问答等多种自然语言处理下游任务。
Core Facts
Timeline (last 90 days)
决策模型是针对单一分类或判断任务定向训练的轻量模型,常见形式包括梯度提升树(XGBoost、LightGBM)、小型微调BERT变体或蒸馏自大模型的Tiny系列
BertViz 是一个专为 BERT 等 Transformer 模型设计的交互式注意力可视化库,支持在 Jupyter Notebook 中加载 HuggingFace 模型并探索各层各头的注意力分布
BERT系列模型普遍使用WordPiece分词算法,未在词表中的词被切分为子词单元并以##前缀标记
论文《BERT has a Mouth, and It Must Speak》(2019)通过迭代式掩码与填充让BERT生成连贯文本
[CLS] token由BERT引入,在视觉Transformer中拼接在patch token序列开头并经自注意力汇聚全图语义信息,但聚合过程会丢失大量空间局部信息
BERT 微调通常只需数百到数千条样本即可在下游分类任务上达到较好效果
对于文本较短且类别边界清晰的任务(如垃圾邮件过滤),TF-IDF 方案往往已经够用;语义细粒度要求高时 BERT 微调收益更显著
传统的 TF-IDF + 逻辑回归方案不依赖预训练,将文本转为词频统计向量后训练线性分类器,速度快、资源占用低,但语义理解能力不如 BERT
BERT(Bidirectional Encoder Representations from Transformers)是 Google 于2018年发布的预训练语言模型
Sentence-Transformers(SBERT)由Nils Reimers等人在2019年提出,在预训练BERT之上增加池化层并通过孪生网络结构微调
40 more timeline events
All Facts (20)
GPT和BERT等大语言模型基于自监督学习范式
90%VerifiedBERT由Google于2018年推出,是预训练语言模型的开山之作,首次采用双向编码器架构,在11项NLP基准测试中刷新纪录
80%Verified当前所有主流大模型(GPT、BERT、LLaMA等)都基于Transformer架构
80%VerifiedGLM采用了独特的自回归填空预训练范式,与GPT的纯自回归和BERT的纯掩码语言模型都有所不同
80%Verified大语言模型的预训练阶段本质上属于自监督学习,是一种特殊的非监督学习,模型通过预测下一个词来从海量文本中自动学习语言规律
80%VerifiedBERT由Google于2018年提出,是基于Transformer架构的预训练语言模型
80%VerifiedGLM采用自回归填空训练目标,通过对文本片段随机遮蔽并要求模型自回归还原
75%Verified现代LLM(如GPT系列、Claude、Llama)均基于Transformer架构,其解码过程本质上是一个马尔可夫链
75%VerifiedDistilBERT通过蒸馏将BERT参数量减少40%,推理速度提升60%,性能仅损失约3%
75%VerifiedBERT 采用编码器架构,GPT 系列采用解码器架构,T5 和 BART 采用编码器-解码器架构
75%VerifiedBERT、GPT系列、LLaMA、Claude均以Transformer为基础构建
70%VerifiedTransformer的核心创新是自注意力机制,GPT、Claude、Gemini等主流大模型均基于Transformer构建
70%VerifiedBERT由Google于2018年提出,其双向注意力机制使其在文本分类、语义理解等任务上表现出色
70%Verified原始Transformer由编码器(Encoder)和解码器(Decoder)构成,BERT类模型只用编码器擅长理解和分类,GPT类模型只用解码器专注文本生成
65%VerifiedTransformer架构分化为BERT类(Encoder-only,适合理解任务)和GPT类(Decoder-only,适合生成任务)两大路线
65%VerifiedBERT于2018年由Google提出,是双向编码器;GPT于2018年由OpenAI提出,是自回归解码器
65%VerifiedTransformers框架支持的文本模型包括GPT、BERT、LLaMA、T5等,视觉模型包括ViT、CLIP、Stable Diffusion等,音频模型包括Whisper、Wav2Vec等,多模态模型包括LLaVA、Qwen-VL等
65%UnverifiedBERT的参数规模为3.4亿,GPT-3的参数规模为1750亿
95%Unverified2018年BERT预训练模型问世,通过在海量文本上预训练,模型能够捕捉词语在不同语境下的细微含义差异
95%UnverifiedThe Transformer spawned two major technical paths: the encoder approach represented by BERT (excelling at understanding) and the decoder approach represented by GPT (excelling at generation), with the decoder approach becoming the dominant paradigm for large language models
92%