Unverified50% confidenceFactExact time
LLM评测方法经历了从BLEU/ROUGE词汇重叠指标,到MMLU、HumanEval等离线静态基准,再到面向生产环境的实时动态评测的演变
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
UnverifiedLLM可通过分析输出token的对数概率分布、思维链末尾自我评估、温度采样统计答案分布熵值等手段近似估计决策置信度67% similarUnverified前沿模型的认定更多依赖于能力评估基准(如MMLU、HumanEval、MATH)的综合表现,而非单纯参数规模67% similarUnverifiedLLM应用的行为由系统提示词、RAG数据源、底层模型版本、工具调用与Agent能力等高度可变的部分共同决定66% similarUnverified2024年多项研究表明LLM存在显著的'自我一致性偏差',当被要求评估自己生成的内容时,模型倾向于给出过高评价66% similarUnverifiedLLM在「生成」和「评估」时激活的推理路径不同,生成任务偏向延续已有语义方向,评估任务激活更多批判性、面向异常检测的推理路径66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/516646API
curl https://kongchang.com/api/v1/knowledge/claims/516646MCP
get_claim(id=516646)