Unverified50% confidenceOpinionExact time
众包式盲测评测被认为比传统学术基准测试(如MMLU、HumanEval)更能反映模型在开放式对话中的综合表现
1
Sources
50%
Confidence
Long-term
Relevance
8/24/2026
First Seen
Sources
Related Entities
Related Claims
Unverified顶级模型在许多评估任务上已接近人类裁判的水平,但存在倾向于给较长回答打高分等偏见69% similarUnverified研究发现当提示词将模型设定为严谨的学术研究者角色时,其引用密度和真实性均显著高于通用对话角色69% similarUnverified人类标注者在评估答案时存在信息越丰富越好的认知偏差,导致奖励模型将篇幅与质量隐性挂钩,是模型冗余的成因之一67% similarUnverified目前主流LLM评测基准如MMLU、HumanEval、MT-Bench主要关注知识能力和指令遵循能力,对谄媚行为的系统性评估尚未形成行业标准66% similarUnverified评级结果依赖观察者主观判断,不同人对同一样品的读数可能存在半级至一级偏差,难以做到完全客观统一66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/795684API
curl https://kongchang.com/api/v1/knowledge/claims/795684MCP
get_claim(id=795684)