T5
Google开发的基于完整Encoder-Decoder架构的预训练语言模型,在机器翻译、摘要生成等序列到序列任务上表现突出
核心事实
时间轴 (近 90 天)
FastModel 现可微调 T5、T5Gemma、BART、Marian 等文本编码器-解码器模型
Transformer架构是BERT、T5、LLaMA等现代大语言模型的基础
相比纯decoder架构(如GPT),GLM在中文NLU任务上平均提升8-15个百分点;相比encoder-decoder架构(如T5),推理效率提升约40%
CLIP或T5等文本编码器在处理数字概念时往往将其编码为模糊的量感而非精确的计数指令
Transformers come in three variants: encoder-only (like BERT), decoder-only (like GPT), and encoder-decoder (like T5)
现代LLM(如GPT系列、Claude、Llama)均基于Transformer架构,其解码过程本质上是一个马尔可夫链
BERT于2018年由Google提出,是双向编码器;GPT于2018年由OpenAI提出,是自回归解码器
全部知识事实 (11)
现代LLM(如GPT系列、Claude、Llama)均基于Transformer架构,其解码过程本质上是一个马尔可夫链
75%已验证T5由Google于2019年提出,将所有NLP任务统一为文本到文本格式
75%已验证BERT 采用编码器架构,GPT 系列采用解码器架构,T5 和 BART 采用编码器-解码器架构
75%已验证BERT于2018年由Google提出,是双向编码器;GPT于2018年由OpenAI提出,是自回归解码器
65%已验证编码器-解码器架构相比纯解码器架构,编码器一次性压缩长输入为固定维度语义向量,解码器专注生成短结构化输出,是Needle针对工具调用任务的工程取舍
65%已验证Transformers框架支持的文本模型包括GPT、BERT、LLaMA、T5等,视觉模型包括ViT、CLIP、Stable Diffusion等,音频模型包括Whisper、Wav2Vec等,多模态模型包括LLaVA、Qwen-VL等
65%部分验证Transformers come in three variants: encoder-only (like BERT), decoder-only (like GPT), and encoder-decoder (like T5)
65%待验证FastModel 现可微调 T5、T5Gemma、BART、Marian 等文本编码器-解码器模型
50%待验证Transformer架构是BERT、T5、LLaMA等现代大语言模型的基础
50%待验证相比纯decoder架构(如GPT),GLM在中文NLU任务上平均提升8-15个百分点;相比encoder-decoder架构(如T5),推理效率提升约40%
50%待验证CLIP或T5等文本编码器在处理数字概念时往往将其编码为模糊的量感而非精确的计数指令
50%