Unverified50% confidenceSolutionExact time
评分 API 可对检索的候选文档或模型生成的候选答案进行相关性/质量打分,帮助筛选最优结果以减少幻觉现象
1
Sources
50%
Confidence
Long-term
Relevance
10/4/2026
First Seen
Sources
Related Entities
Related Claims
Unverified有价值的对比测试工具理想状态下应具备标准化任务集、自动化评分机制和结果可视化呈现能力72% similarUnverified评估大模型时更可靠的做法是构建与自身业务强相关的领域专属评测集,在真实输入分布上进行盲测对比71% similarUnverified知识库评估重点包括检索准确性、召回率、忠诚度(生成结果是否有参考资料支撑)及各环节协同效果71% similarUnverified在采信LLM裁判评分前必须用人工标注对其进行校准,缓解偏差手段包括交换候选顺序取平均、使用CoT提示、多裁判集成70% similarUnverified选型建议:应在自己的真实任务上做对比测试,评估代码生成、长文本理解、指令遵循等维度,并综合考量API定价与调用限制,而非仅追逐单次榜单排名70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/971714API
curl https://kongchang.com/api/v1/knowledge/claims/971714MCP
get_claim(id=971714)