[控场AI]
概念向量化

Embedding

Embedding(嵌入)是一种将离散对象(如文本、图像、用户行为等)映射为低维连续向量空间中稠密向量的表示学习技术。其核心特征是语义相似的对象在向量空间中距离相近,从而使计算机能够捕捉对象间的语义关系。Embedding广泛应用于自然语言处理、推荐系统、信息检索等领域,是深度学习模型处理非数值型数据的基础方法。

核心事实

时间轴 (近 90 天)

6月3日

嵌入模型通常只有几百MB大小,将文本转化为768维(或其他维度)的向量

待验证70%
6月1日

OpenAI 的 text-embedding-3-small 模型会将文本转换为 1536 维的浮点数数组

已验证80%
6月1日

OpenAI的text-embedding-3-small/large系列是目前商用场景中最常用的嵌入模型

待验证75%
6月1日

OpenAI的text-embedding-ada-002和开源的sentence-transformers系列是常用的嵌入模型

待验证60%
6月1日

向量数据库存储的是文本经过Embedding模型转换后的高维向量,通常为768或1536维

已验证80%
6月1日

OpenAI的text-embedding-ada-002和开源的BGE系列是常用的Embedding模型

已验证80%
6月1日

现代Embedding模型(如OpenAI的text-embedding-ada-002、阿里的千问Embedding系列)能够将整个句子或段落编码为固定维度的稠密向量,通常为768维或1024维

待验证60%
6月1日

Embedding模型通常将文本映射到768或1536维的高维向量空间

已验证80%
6月1日

中文场景下BGE、M3E等国产Embedding模型往往优于通用的OpenAI Embedding

待验证60%
6月1日

BGE和text-embedding-3是当前可选的向量嵌入(Embedding)模型

待验证90%

还有 18 条时间轴事件

来源文章