Unverified50% confidenceFactTime unknown
Character-count-based chunking (e.g., every 300 characters) is simple but prone to breaking semantic coherence.
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
UnverifiedFixed-length chunking strategies in Naive RAG cut coherent semantic paragraphs in half, causing context loss.68% similarVerifiedtext-embedding-ada-002将文本转化为1536维的稠密向量,语义相近的文本在向量空间中距离更近62% similarUnverified大模型处理文本以Token(词元)为最小处理单元,由分词器完成切分61% similarUnverified重排模块需要同时持有文本内容和原始检索分数(scored chunks),若检索返回纯文本会导致格式错位59% similarUnverified向量数据库通过将文本嵌入为高维向量并计算余弦相似度实现语义检索,但缺乏结构化关系表达能力59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/57359API
curl https://kongchang.com/api/v1/knowledge/claims/57359MCP
get_claim(id=57359)