待验证60% 置信事实时间未知
OpenAI 使用 tiktoken 分词算法,Google 使用 SentencePiece 分词算法
2
来源数
60%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
One API:统一管理30+大模型的开源API网关部署教程与详解
githubsongquanpeng
涉及实体
相关事实
待验证现代 LLM 使用子词分词算法,最常见的包括 OpenAI 提出的 BPE 和 Google 提出的 SentencePiece82% 相似待验证不同模型使用不同的分词算法,如 OpenAI 的 tiktoken、Google 的 SentencePiece,导致同一段文字在不同模型中消耗的 token 数量可能相差 10%-30%75% 相似待验证现代大语言模型普遍采用BPE算法变体构建分词器,OpenAI的tiktoken、Google的SentencePiece和HuggingFace的Tokenizers库是三大主流实现71% 相似待验证OpenAI 使用基于字节对编码(BPE)的 tiktoken 分词器将文本切分为 Token68% 相似待验证OpenAI的text-embedding-ada-002和开源的sentence-transformers系列是常用的嵌入模型66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/34785API
curl https://kongchang.com/api/v1/knowledge/claims/34785MCP
get_claim(id=34785)