[控场AI]
基准EleutherAI LM Evaluation Harness

LM Evaluation Harness

EleutherAI开源的大语言模型标准化评测框架,支持多种基准测试集,流程透明可复现,被广泛用于学术和社区模型评估

来源文章