text-embedding-ada-002
OpenAI 推出的文本嵌入模型,将文本映射到高维连续向量空间,用于语义搜索、相似度计算等任务,是最常用的商业 Embedding 模型之一。
核心事实
时间轴 (近 90 天)
嵌入相似度方法将文档和概念描述编码为高维向量,通过余弦相似度等度量判断语义接近程度,依赖预训练句子编码器如Sentence-BERT、text-embedding-ada-002
常用嵌入模型包括OpenAI的text-embedding-ada-002和可本地运行的sentence-transformers
cl100k_base 是 GPT-4 和 text-embedding-ada-002 等模型采用的具体词表
全部知识事实 (7)
OpenAI的text-embedding-ada-002和开源的BGE系列是常用的Embedding模型
80%待验证知识库检索中,文档分段后每个文本块通过嵌入模型(如text-embedding-ada-002或BGE系列)转换为高维向量存储在向量数据库中
90%待验证OpenAI的text-embedding-ada-002和开源的sentence-transformers系列是常用的嵌入模型
60%待验证现代Embedding模型(如OpenAI的text-embedding-ada-002、阿里的千问Embedding系列)能够将整个句子或段落编码为固定维度的稠密向量,通常为768维或1024维
60%待验证嵌入相似度方法将文档和概念描述编码为高维向量,通过余弦相似度等度量判断语义接近程度,依赖预训练句子编码器如Sentence-BERT、text-embedding-ada-002
50%待验证常用嵌入模型包括OpenAI的text-embedding-ada-002和可本地运行的sentence-transformers
50%待验证cl100k_base 是 GPT-4 和 text-embedding-ada-002 等模型采用的具体词表
50%