向量检索
向量检索是一种将数据(文本、图像、音频等)转化为高维数值向量,并通过计算向量间相似度(如余弦相似度、欧氏距离)来检索语义相关内容的技术。与传统关键词匹配不同,向量检索能够捕捉语义层面的相关性,支持模糊查询和跨模态检索,广泛应用于信息检索、推荐系统、问答系统及大规模语义搜索等领域。
核心事实
时间轴 (近 90 天)
向量检索只能回答什么和什么相似,无法回答什么和什么相连、为什么相连、怎么连上的
向量检索只能回答什么和什么相似,无法回答什么和什么相连、为什么相连、怎么连上的问题,跨越多个实体做推理时会失效
对于简单事实问答,向量检索已足够,使用知识图谱是过度设计
标准向量RAG只能找到与查询语义相似的孤立片段,无法理解片段之间的关系
全局查询能回答需要宏观视角的归纳性问题(如整个文档集的主要主题),这是纯向量检索几乎无法胜任的场景
多跳查询需要跨越多个信息节点、层层递进,向量检索因缺少关系维度而不擅长处理这类场景
相比传统关键词检索,向量检索能理解语义等价性,检索准确率提升30-50%
基于语义相似度的向量检索存在局限:可能遗漏时间顺序上重要但语义不相似的决策,缺乏冲突消解机制,关键信息可能被遗漏或淹没
向量检索基于语义相似度而非精确匹配,导致语义相近但数值不同的内容(如1500亿美元与2500亿美元)在向量空间中距离很近,存在区分数值准确性的结构性盲区
现代RAG系统广泛采用向量检索技术,通过嵌入模型将文本转为高维向量并计算余弦相似度找到相关文档
还有 5 条时间轴事件
全部知识事实 (17)
向量数据库将文本内容通过嵌入模型(Embedding Model)转化为高维数值向量,检索时通过余弦相似度等算法找出语义最接近的内容
80%已验证关键词搜索基于精确字符匹配无法理解同义词,语义搜索依赖向量嵌入可捕捉语义关联,两者结合的混合检索效果优于单一方法
65%已验证语义相近的文本在向量空间中距离也相近,这是向量检索的数学基础
65%待验证向量检索只能回答什么和什么相似,无法回答什么和什么相连、为什么相连、怎么连上的
50%待验证向量检索只能回答什么和什么相似,无法回答什么和什么相连、为什么相连、怎么连上的问题,跨越多个实体做推理时会失效
50%待验证对于简单事实问答,向量检索已足够,使用知识图谱是过度设计
50%待验证标准向量RAG只能找到与查询语义相似的孤立片段,无法理解片段之间的关系
50%待验证多跳查询需要跨越多个信息节点、层层递进,向量检索因缺少关系维度而不擅长处理这类场景
50%待验证全局查询能回答需要宏观视角的归纳性问题(如整个文档集的主要主题),这是纯向量检索几乎无法胜任的场景
50%待验证相比传统关键词检索,向量检索能理解语义等价性,检索准确率提升30-50%
50%待验证基于语义相似度的向量检索存在局限:可能遗漏时间顺序上重要但语义不相似的决策,缺乏冲突消解机制,关键信息可能被遗漏或淹没
50%待验证向量检索基于语义相似度而非精确匹配,导致语义相近但数值不同的内容(如1500亿美元与2500亿美元)在向量空间中距离很近,存在区分数值准确性的结构性盲区
50%待验证现代RAG系统广泛采用向量检索技术,通过嵌入模型将文本转为高维向量并计算余弦相似度找到相关文档
50%待验证向量检索基于语义相似度的模糊匹配,难以捕捉实体之间的逻辑关系、层级结构和时序演变
50%待验证基于语义相似度的向量检索擅长找到'说的像'的内容,却难以捕捉信息之间的因果链、时序依赖和层级结构
50%待验证知识图谱的多跳推理相比传统向量检索的优势在于能执行'A作用于B,B关联C,C导致D'的链式推理,而向量检索只能基于语义相似度找到最相似的文档片段
50%待验证传统向量检索只能基于语义相似度找到最像的文档片段,无法执行A作用于B、B关联C、C导致D这类链式多跳推理,而知识图谱可通过图遍历算法或图查询语言实现多跳推理
50%