待验证50% 置信事实精确时间
cl100k_base 是 GPT-4 和 text-embedding-ada-002 等模型采用的具体词表
1
来源数
50%
置信度
长期有效
时效性
2026/10/5
首次发现
来源
涉及实体
相关事实
已验证GPT-4系列采用cl100k_base词表(约10万词元),GPT-4o系列升级至o200k_base(约20万词元)78% 相似待验证GPT-4 使用 cl100k_base tokenizer,与 Claude 的 tokenizer 对中文、代码等内容的切分策略不同74% 相似待验证GPT系列使用BPE算法并基于cl100k_base等词表,Llama系列使用SentencePiece,Gemini有自己的专有分词方案71% 相似待验证文中将 Codex 描述为 GPT-4o 的代码增强版本71% 相似已验证GPT-4使用的cl100k_base词表包含约10万个Token单元,可通过tiktoken库精确计算文本的Token数量71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/977588API
curl https://kongchang.com/api/v1/knowledge/claims/977588MCP
get_claim(id=977588)