Unverified50% confidenceBenchmarkExact time
根据待评内容类型通过语义相似度检索动态选择最相关的锚定样本,在实践中可将裁判-人工一致性提升5-15个百分点
1
Sources
50%
Confidence
Long-term
Relevance
8/10/2026
First Seen
Sources
Related Claims
UnverifiedIn RAG, 'most relevant' is typically determined by weighted ranking across multiple signals including semantic similarity, source authority, and content freshness70% similarUnverified研究发现用户偏好可能倾向于更长、格式更精美的回答,即所谓的verbose bias或长度偏差69% similarUnverified人类标注者在评估答案时存在信息越丰富越好的认知偏差,导致奖励模型将篇幅与质量隐性挂钩,是模型冗余的成因之一67% similarUnverified思维链提示(Chain-of-Thought)可提升推理质量,对比提示可降低确认偏误66% similarUnverified查看用户评价时重点看差评中'答非所问''模板化回复''催促线下就医推销'等关键词,比看总体评分更能反映真实问诊质量66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/724022API
curl https://kongchang.com/api/v1/knowledge/claims/724022MCP
get_claim(id=724022)