Unverified50% confidenceSolutionExact time
评估程序会将问题、参考答案、实际回答一并输入裁判模型,附上打分指令(如相关性、准确性、完整性各维度0-5分),由裁判模型输出结构化评分与理由
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
Unverified程序化评估流程包括生成问题集及参考答案、驱动RAG跑出实际答案、对比实际答案与参考答案打分,跑测前最好先做人工校验79% similarUnverified锚定样本技术在评估提示词中加入已由人类专家标注明确分数的示例,覆盖评分量表各个档位,可帮助裁判模型准确理解评分标准74% similarUnverified评估集构建可采用LLM-as-Judge方法用另一个模型评估输出质量以处理语义层面的质量判断74% similarUnverified应建立基准测试机制,使用已知答案的标准问题持续验证Agent输出的准确性74% similarUnverified评估AI攻克难题类报道的四步判断法为:题目是否准确、证明是否公开、有没有独立审阅、能否形式化验算73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/915491API
curl https://kongchang.com/api/v1/knowledge/claims/915491MCP
get_claim(id=915491)