[KongchangAI]
Concept文本嵌入模型 / Embedding

Embedding模型

将文本、图像等非结构化数据转换为高维稠密向量的模型,用于捕捉语义信息,支持语义相似度计算和检索,是RAG系统的核心组件之一

Core Facts

Timeline (last 90 days)

Sep 25

Embedding模型微调通常采用对比学习框架,通过构造正样本对和负样本对训练模型拉近正样本、推开负样本

Unverified50%
Sep 25

选型时需确认模型训练时使用的相似度目标函数与检索时使用的度量方式保持一致,否则会出现系统性偏差

Unverified50%
Sep 25

Embedding 模型的核心作用是把一段纯文本内容转换成向量

Unverified50%
Sep 25

Embedding 模型只负责文本转向量这一步,向量存储到哪个数据库是相对独立的工程选择

Unverified50%
Sep 25

Embedding模型在RAG流程中出现两次:离线构建知识库时和在线检索时,目标都是把文本映射到同一个向量空间

Unverified50%
Sep 11

过短文本的 embedding 向量方向往往不稳定,过滤掉是更稳妥的选择

Unverified50%
Sep 11

Embedding 模型是将文本映射到连续向量空间的神经网络,其核心假设是语义相似的文本其向量距离也应相近

Unverified60%
Sep 11

Embedding 模型对结构化符号(如货币格式、编码字符串、ID序列)缺乏特殊理解,只是把这些内容当作普通 token 序列处理

Unverified50%
Sep 11

价格、日期、分类ID这类结构化数据通常不应该直接嵌入 embedding 模型,而应作为元数据存储用于检索后的过滤与排序

Unverified50%
Sep 11

结构化字段直接嵌入会污染语义空间,导致模型无法区分价格与任意文本

Unverified50%

2 more timeline events

All Facts (14)

Verified

Embedding模型通常将文本映射到768或1536维的高维向量空间

80%
Verified

嵌入模型将文本转化为固定维度的浮点数向量,使语义相近的内容在向量空间中距离更近,是RAG技术的核心底座

70%
Verified

RAG通过将文档切分为语义块后经嵌入模型转化为高维向量存入向量数据库,查询时通过近似最近邻(ANN)搜索找到语义最相近的文档片段

65%
Unverified

Embedding 模型是将文本映射到连续向量空间的神经网络,其核心假设是语义相似的文本其向量距离也应相近

60%
Unverified

Embedding模型微调通常采用对比学习框架,通过构造正样本对和负样本对训练模型拉近正样本、推开负样本

50%
Unverified

Embedding 模型的核心作用是把一段纯文本内容转换成向量

50%
Unverified

Embedding 模型只负责文本转向量这一步,向量存储到哪个数据库是相对独立的工程选择

50%
Unverified

Embedding模型在RAG流程中出现两次:离线构建知识库时和在线检索时,目标都是把文本映射到同一个向量空间

50%
Unverified

选型时需确认模型训练时使用的相似度目标函数与检索时使用的度量方式保持一致,否则会出现系统性偏差

50%
Unverified

Embedding 模型对结构化符号(如货币格式、编码字符串、ID序列)缺乏特殊理解,只是把这些内容当作普通 token 序列处理

50%
Unverified

价格、日期、分类ID这类结构化数据通常不应该直接嵌入 embedding 模型,而应作为元数据存储用于检索后的过滤与排序

50%
Unverified

结构化字段直接嵌入会污染语义空间,导致模型无法区分价格与任意文本

50%
Unverified

过短文本的 embedding 向量方向往往不稳定,过滤掉是更稳妥的选择

50%
Unverified

开源Embedding模型如BAAI/bge-large和intfloat/e5-large-v2在多个基准测试中已经接近甚至超过商业API的效果

50%

Source Articles