BM25(Best Match 25)是信息检索领域广泛使用的经典排名算法,属于概率检索模型。它基于词频(TF)、逆文档频率(IDF)及文档长度归一化等因素计算查询词与文档的相关性得分,用于对搜索结果进行排序。BM25以稳健的关键词匹配能力著称,常作为文本检索系统的基线算法,并可与语义检索方法结合使用。
Cloud Context采用BM25+向量混合搜索架构,在同等检索质量下可减少40%的Token消耗
混合检索(Hybrid Search)将BM25与向量检索结合,在实际生产环境中通常能获得比单一检索方式高10-20%的召回率提升
BM25(Best Matching 25)是由Stephen Robertson等人在1990年代提出的概率排序算法,基于词频、逆文档频率和文档长度归一化三个因素进行相关性打分
BM25是一种基于词频统计(TF-IDF改进版)的经典信息检索算法,属于稀疏检索方法
论文评估了6个主流记忆系统:BM25、Text Embedding 3 Small、Memo-Me、GraphTD、Carp-Wiki、MD-Flat
Symbol结合BM25词法检索和轻量级Embedding做混合排序
混合检索(Hybrid Search)将向量检索与BM25关键词检索的结果通过RRF(倒数排名融合)等算法合并,兼顾语义理解与精确匹配
BM25是基于词频统计的经典关键词检索算法,与向量检索形成互补
BM25仍是Elasticsearch、Lucene等主流搜索引擎的默认排序算法
Context Mode使用BM25算法检索相关内容,生成不超过2KB的Session Guide