待验证50% 置信基准精确时间
社区常用的量化评估基准包括MMLU、HumanEval和GSM8K,困惑度是衡量语言模型流畅度的通用指标
1
来源数
50%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
待验证代码模型采用HumanEval、MBPP等可执行基准进行评估,通用语言模型则依赖困惑度等统计指标76% 相似待验证过去几年大模型能力评估多集中在MMLU、GSM8K、HumanEval等学术型基准上72% 相似待验证MMLU曾是衡量大语言模型知识水平的黄金标准,在ChatGPT问世年代几乎是每份模型发布报告的必备指标66% 相似待验证LLM评估解决的核心问题是当模型输出是开放式自然语言时如何系统衡量其质量,常见维度包括准确性、忠实度、相关性和安全性65% 相似待验证LLM 评估需要处理语义相似性而非精确匹配,因此评测框架本身也依赖语言模型作为裁判(LLM-as-a-Judge)63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/931029API
curl https://kongchang.com/api/v1/knowledge/claims/931029MCP
get_claim(id=931029)