待验证50% 置信事实精确时间
主流评测体系包括MMLU(57个学科知识广度)、HumanEval和MBPP(代码生成)、GSM8K和MATH(数学推理)、MT-Bench和Chatbot Arena(人类偏好投票)
1
来源数
50%
置信度
长期有效
时效性
2026/8/30
首次发现
来源
涉及实体
相关事实
待验证目前主流LLM评测基准如MMLU、HumanEval、MT-Bench主要关注知识能力和指令遵循能力,对谄媚行为的系统性评估尚未形成行业标准76% 相似待验证众包式盲测评测被认为比传统学术基准测试(如MMLU、HumanEval)更能反映模型在开放式对话中的综合表现62% 相似待验证用户评价体系需辨别:平台内评分易被筛选美化,应关注是否允许中差评展示、是否有'脱落率'或匹配成功率等客观数据,纯五星好评平台反而需警惕58% 相似待验证LMSYS 的 Chatbot Arena(lmarena.ai)以双盲对比方式让用户在不知道模型身份的情况下评分,排名结果相比商业宣传更具参考价值58% 相似待验证Braintrust、Patronus等偏评测视角的工具关注模型输出的质量评分58% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/824049API
curl https://kongchang.com/api/v1/knowledge/claims/824049MCP
get_claim(id=824049)