Unverified50% confidenceFactExact time
该系统采用双重索引设计,文档被切分为600字符、100字符重叠的文本块,用 NOMIC embed text 生成向量嵌入并存入 ChromaDB
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
10/7/2026
First Seen
Valid until: 1/5/2027
Sources
Related Entities
Related Claims
Unverified常见的文档分片方式有四种:按字数划分、按段落划分、按章节划分、按页码划分64% similarUnverified现代LLM的分词器通常将文本压缩为约10万词汇量的Token序列61% similarUnverified上下文窗口决定模型单次能处理的文本量:8K约6000词,32K约24000词,128K可处理整本书内容61% similarUnverifiedlangchain-text-splitters 负责将长文档切分成适合嵌入模型和大语言模型上下文窗口的文本块60% similarUnverifiedCLIP文本编码器的标准上下文窗口长度约为77个Token,超出部分的语义信息会被截断或降权处理60% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/983697API
curl https://kongchang.com/api/v1/knowledge/claims/983697MCP
get_claim(id=983697)