sentence-transformers
基于Python的开源文本向量化框架,能将句子、段落编码为固定维度的语义向量,广泛用于语义搜索、RAG和文本相似度计算等NLP任务
时间轴 (近 90 天)
若同一段文本在同一批中出现两次,损失函数会把重复段落当作错误答案,应使用no-duplicate sampler避免
多重负样本排序损失(MNRL)在一批数据中把每个问题对应的段落作为正例,同批其余段落作为负例,无需手动收集负样本
常用嵌入模型包括OpenAI的text-embedding-ada-002和可本地运行的sentence-transformers
sentence-transformers可本地运行,在隐私敏感场景下尤为适用
Nils Reimers 最广为人知的工作是 sentence-transformers 开源库及其背后的 Sentence-BERT(SBERT)系列模型
项目采用 RAG 方案,通过 sentence-transformers 生成向量、FAISS 完成向量检索,对公司的数据表结构、KPI 定义和业务规则进行语义检索
常见的语义搜索实现方案包括 OpenAI 的 text-embedding 系列模型或开源的 sentence-transformers,并使用 Pinecone、Qdrant 等向量数据库
使用轻量级embedding模型如sentence-transformers的MiniLM每次推理需要几十毫秒,大型embedding模型可能达数百毫秒
本地可运行的 sentence-transformers 系列模型(如 all-MiniLM-L6-v2)能完全离线工作,而 OpenAI 的 text-embedding-3-small 等云端模型精度较高但需要联网
全部知识事实 (10)
OpenAI的text-embedding-ada-002和开源的sentence-transformers系列是常用的嵌入模型
60%待验证若同一段文本在同一批中出现两次,损失函数会把重复段落当作错误答案,应使用no-duplicate sampler避免
50%待验证多重负样本排序损失(MNRL)在一批数据中把每个问题对应的段落作为正例,同批其余段落作为负例,无需手动收集负样本
50%待验证常用嵌入模型包括OpenAI的text-embedding-ada-002和可本地运行的sentence-transformers
50%待验证sentence-transformers可本地运行,在隐私敏感场景下尤为适用
50%待验证Nils Reimers 最广为人知的工作是 sentence-transformers 开源库及其背后的 Sentence-BERT(SBERT)系列模型
50%待验证项目采用 RAG 方案,通过 sentence-transformers 生成向量、FAISS 完成向量检索,对公司的数据表结构、KPI 定义和业务规则进行语义检索
50%待验证常见的语义搜索实现方案包括 OpenAI 的 text-embedding 系列模型或开源的 sentence-transformers,并使用 Pinecone、Qdrant 等向量数据库
50%待验证使用轻量级embedding模型如sentence-transformers的MiniLM每次推理需要几十毫秒,大型embedding模型可能达数百毫秒
50%待验证本地可运行的 sentence-transformers 系列模型(如 all-MiniLM-L6-v2)能完全离线工作,而 OpenAI 的 text-embedding-3-small 等云端模型精度较高但需要联网
50%