Embedding模型
将文本、图像等非结构化数据转换为高维稠密向量的模型,用于捕捉语义信息,支持语义相似度计算和检索,是RAG系统的核心组件之一
核心事实
时间轴 (近 90 天)
Embedding模型微调通常采用对比学习框架,通过构造正样本对和负样本对训练模型拉近正样本、推开负样本
选型时需确认模型训练时使用的相似度目标函数与检索时使用的度量方式保持一致,否则会出现系统性偏差
Embedding 模型的核心作用是把一段纯文本内容转换成向量
Embedding 模型只负责文本转向量这一步,向量存储到哪个数据库是相对独立的工程选择
Embedding模型在RAG流程中出现两次:离线构建知识库时和在线检索时,目标都是把文本映射到同一个向量空间
过短文本的 embedding 向量方向往往不稳定,过滤掉是更稳妥的选择
Embedding 模型是将文本映射到连续向量空间的神经网络,其核心假设是语义相似的文本其向量距离也应相近
Embedding 模型对结构化符号(如货币格式、编码字符串、ID序列)缺乏特殊理解,只是把这些内容当作普通 token 序列处理
价格、日期、分类ID这类结构化数据通常不应该直接嵌入 embedding 模型,而应作为元数据存储用于检索后的过滤与排序
结构化字段直接嵌入会污染语义空间,导致模型无法区分价格与任意文本
还有 2 条时间轴事件
全部知识事实 (14)
Embedding模型通常将文本映射到768或1536维的高维向量空间
80%已验证嵌入模型将文本转化为固定维度的浮点数向量,使语义相近的内容在向量空间中距离更近,是RAG技术的核心底座
70%已验证RAG通过将文档切分为语义块后经嵌入模型转化为高维向量存入向量数据库,查询时通过近似最近邻(ANN)搜索找到语义最相近的文档片段
65%待验证Embedding 模型是将文本映射到连续向量空间的神经网络,其核心假设是语义相似的文本其向量距离也应相近
60%待验证Embedding模型微调通常采用对比学习框架,通过构造正样本对和负样本对训练模型拉近正样本、推开负样本
50%待验证Embedding 模型的核心作用是把一段纯文本内容转换成向量
50%待验证Embedding 模型只负责文本转向量这一步,向量存储到哪个数据库是相对独立的工程选择
50%待验证Embedding模型在RAG流程中出现两次:离线构建知识库时和在线检索时,目标都是把文本映射到同一个向量空间
50%待验证选型时需确认模型训练时使用的相似度目标函数与检索时使用的度量方式保持一致,否则会出现系统性偏差
50%待验证Embedding 模型对结构化符号(如货币格式、编码字符串、ID序列)缺乏特殊理解,只是把这些内容当作普通 token 序列处理
50%待验证价格、日期、分类ID这类结构化数据通常不应该直接嵌入 embedding 模型,而应作为元数据存储用于检索后的过滤与排序
50%待验证结构化字段直接嵌入会污染语义空间,导致模型无法区分价格与任意文本
50%待验证过短文本的 embedding 向量方向往往不稳定,过滤掉是更稳妥的选择
50%待验证开源Embedding模型如BAAI/bge-large和intfloat/e5-large-v2在多个基准测试中已经接近甚至超过商业API的效果
50%