Unverified50% confidenceFactExact time
传统大语言模型评测围绕单轮问答的准确性展开,给定问题输出答案后对照标准答案打分
1
Sources
50%
Confidence
Long-term
Relevance
9/21/2026
First Seen
Sources
Related Entities
Related Claims
Unverified大型语言模型可通过分析token概率分布、显式输出自我评估分数或多次采样观察答案一致性等手段近似估计决策置信度80% similarUnverified答案解析的鲁棒性往往直接决定评估得分,因为模型可能以多种格式表达同一答案78% similarUnverified自适应访谈与固定问卷的关键区别在于后续问题基于前一个答案的内容动态生成,依赖大语言模型的上下文理解能力74% similarUnverified指令微调使用问题-答案对格式的数据集进行训练,使模型更好地遵循自然语言指令73% similarUnverified评估指标以各模型自身正常散文输出为基线,采用各模型自身分词器计算的Token数以保证比较公平性72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/939640API
curl https://kongchang.com/api/v1/knowledge/claims/939640MCP
get_claim(id=939640)