BERT
BERT(Bidirectional Encoder Representations from Transformers)是由Google提出的预训练语言表示模型,采用双向Transformer编码器架构。其核心预训练任务包括掩码语言模型(MLM)和下一句预测(NSP),通过大规模无标注文本进行自监督学习,从而获得深层双向语义表示。经过微调后,BERT可广泛应用于文本分类、命名实体识别、问答等多种自然语言处理下游任务。
核心事实
时间轴 (近 90 天)
ModernBERT是2024年底发布的BERT架构改进版,引入了旋转位置编码(RoPE)和交替局部/全局注意力等现代化设计
RoBERTa是Facebook AI在BERT基础上优化训练的语言模型
离散掩码扩散借鉴BERT的掩码语言建模思路,训练时对序列随机掩码并还原,推理时从全掩码序列多步迭代填充,代表工作有MDLM、SEDD
NLP方向以Transformer架构为基础,需要掌握预训练语言模型(如BERT、GPT系列)的原理、微调方法(如LoRA、Prompt Tuning)以及文本向量化技术
原始Transformer由编码器(Encoder)和解码器(Decoder)构成,BERT类模型只用编码器擅长理解和分类,GPT类模型只用解码器专注文本生成
bert4torch 用相对精简的代码结构,让使用者能够清楚看到 BERT 及其衍生模型的搭建方式
bert4keras 以极简代码实现了 BERT、RoBERTa、ALBERT、GPT 等系列模型
BERT于2018年发布,GPT-3于2020年发布,ChatGPT于2022年发布
OpenAI、Google 及各类开源模型(如 BERT、Sentence Transformers)生成的向量在维度、数值分布和语义排列方式上各不相同
许多轻量级的可视化工具会选择使用较小的模型(如 GPT-2、BERT),或者预先计算好注意力数据以供离线浏览,以平衡性能与实时性
还有 40 条时间轴事件
全部知识事实 (20)
当前所有主流大模型(GPT、BERT、LLaMA等)都基于Transformer架构
80%已验证GLM采用了独特的自回归填空预训练范式,与GPT的纯自回归和BERT的纯掩码语言模型都有所不同
80%已验证大语言模型的预训练阶段本质上属于自监督学习,是一种特殊的非监督学习,模型通过预测下一个词来从海量文本中自动学习语言规律
80%已验证GLM采用自回归填空训练目标,通过对文本片段随机遮蔽并要求模型自回归还原
75%已验证现代LLM(如GPT系列、Claude、Llama)均基于Transformer架构,其解码过程本质上是一个马尔可夫链
75%已验证Transformer架构分化为BERT类(Encoder-only,适合理解任务)和GPT类(Decoder-only,适合生成任务)两大路线
65%已验证BERT于2018年由Google提出,是双向编码器;GPT于2018年由OpenAI提出,是自回归解码器
65%已验证BERT、GPT系列、LLaMA、Claude均以Transformer为基础构建
65%已验证Transformer的核心创新是自注意力机制,GPT、Claude、Gemini等主流大模型均基于Transformer构建
65%已验证BERT由Google于2018年提出,其双向注意力机制使其在文本分类、语义理解等任务上表现出色
65%待验证The Transformer spawned two major technical paths: the encoder approach represented by BERT (excelling at understanding) and the decoder approach represented by GPT (excelling at generation), with the decoder approach becoming the dominant paradigm for large language models
92%部分验证Transformers come in three variants: encoder-only (like BERT), decoder-only (like GPT), and encoder-decoder (like T5)
65%待验证ModernBERT是2024年底发布的BERT架构改进版,引入了旋转位置编码(RoPE)和交替局部/全局注意力等现代化设计
50%待验证RoBERTa是Facebook AI在BERT基础上优化训练的语言模型
50%待验证离散掩码扩散借鉴BERT的掩码语言建模思路,训练时对序列随机掩码并还原,推理时从全掩码序列多步迭代填充,代表工作有MDLM、SEDD
50%待验证NLP方向以Transformer架构为基础,需要掌握预训练语言模型(如BERT、GPT系列)的原理、微调方法(如LoRA、Prompt Tuning)以及文本向量化技术
50%待验证原始Transformer由编码器(Encoder)和解码器(Decoder)构成,BERT类模型只用编码器擅长理解和分类,GPT类模型只用解码器专注文本生成
50%待验证bert4torch 用相对精简的代码结构,让使用者能够清楚看到 BERT 及其衍生模型的搭建方式
50%待验证bert4keras 以极简代码实现了 BERT、RoBERTa、ALBERT、GPT 等系列模型
50%待验证OpenAI、Google 及各类开源模型(如 BERT、Sentence Transformers)生成的向量在维度、数值分布和语义排列方式上各不相同
50%