BenchmarkEleutherAI LM Evaluation Harness
LM Evaluation Harness
EleutherAI开源的大语言模型标准化评测框架,支持多种基准测试集,流程透明可复现,被广泛用于学术和社区模型评估
Timeline (last 90 days)
Sep 12
社区中较受认可的公开评测框架包括LMSYS Chatbot Arena、EleutherAI的LM Evaluation Harness以及HuggingFace Open LLM Leaderboard
Unverified50%