[KongchangAI]
BenchmarkEleutherAI LM Evaluation Harness

LM Evaluation Harness

EleutherAI开源的大语言模型标准化评测框架,支持多种基准测试集,流程透明可复现,被广泛用于学术和社区模型评估

Timeline (last 90 days)

Sep 12

社区中较受认可的公开评测框架包括LMSYS Chatbot Arena、EleutherAI的LM Evaluation Harness以及HuggingFace Open LLM Leaderboard

Unverified50%

All Facts (1)

Source Articles