ReLE中文大模型评测:374个模型的能力排行榜与缺陷库

ReLE是一个收录374个模型、附带200万条缺陷库的持续更新中文大模型开源评测项目。
GitHub开源项目ReLE评测专注于中文AI大模型的横向比较,目前已收录374个模型,涵盖ChatGPT、Gemini、Claude等国际主流商用模型,以及文心、通义千问、DeepSeek等国产模型,同时也包括Llama、Mistral等开源阵营。项目的核心差异化在于除排行榜外还开放了规模超200万条的大模型缺陷库,记录模型具体出错案例,对做微调与对齐研究的团队具有实用价值。项目在GitHub获近6000 Star,适合作为大模型选型的参考起点,但需理性认识榜单在时效性和方法论上的固有局限。
一个持续更新的中文大模型评测项目
在大模型竞争白热化的当下,如何客观衡量各家模型在中文场景下的真实能力,成为开发者和研究者共同关心的问题。GitHub 上的开源项目 jeinlee1991/chinese-llm-benchmark 给出了一个持续更新的答案——ReLE 评测。
该项目专注于中文 AI 大模型的能力评测,目前已经收录了 374 个大模型,并同时提供排行榜与规模超过 200 万条的大模型缺陷库。凭借这一定位,项目在社区获得了近 6000 个 Star 和超过 240 次 Fork,显示出较高的关注度。

覆盖商用与开源两大阵营
ReLE 评测最大的价值之一在于覆盖面广。它把当前主流的商用模型和开源模型都纳入了同一套评测体系,方便横向比较。
商用模型阵营
在闭源商用模型部分,项目覆盖了国内外的头部产品,包括 ChatGPT、GPT-5.4、谷歌 Gemini-3.1-Pro、Claude-4.6 等国际模型,以及文心 ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤 senseChat 等国产模型。这种把国内外顶级模型放在中文语境下同台比较的做法,对判断国产模型的追赶进度具有参考意义。
开源模型阵营
开源部分同样阵容庞大,收录了 step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱 GLM-5.1、MiMo-V2、LongCat、gemma4、mistral 等模型。对于希望本地部署或二次开发的团队来说,这份开源榜单能帮助他们在有限算力下选择性价比更高的基座模型。

不止排行榜:200万级缺陷库的独特价值
相比市面上单纯给出分数排名的评测项目,ReLE 的差异化在于它同时开放了一个规模超过 200 万条的大模型缺陷库。
排行榜告诉你哪个模型更强,而缺陷库则告诉你模型在哪里出错、为什么出错。这类数据对于研究者分析模型的能力边界、复现失败案例、以及有针对性地改进模型都极具价值。对做微调和对齐的团队而言,系统化的缺陷样本往往比一个笼统的总分更有实操意义。
从社区角度看,把缺陷数据开放出来,意味着任何人都可以基于这批真实错误案例做二次研究,而不必从零构建测试集,这降低了大模型评估研究的门槛。
如何看待这类第三方评测
需要理性看待的是,任何评测榜单都有其方法论假设和覆盖局限。模型版本迭代速度极快,榜单的时效性依赖持续更新;同时中文能力本身涵盖理解、推理、生成、安全等多个维度,单一排名难以完整刻画一个模型的全貌。
因此,ReLE 这类项目更适合作为选型的参考起点,而非唯一依据。它的真正长处在于广覆盖 + 持续更新 + 开放缺陷数据这套组合——既能帮助普通用户快速了解模型格局,也能为专业研究者提供可复用的分析素材。
对于关注中文大模型进展的开发者来说,这是一个值得收藏并定期回看的开源资源。
相关推荐

AI编程模型对比测试工具:GPT-5.3 Codex 与 Claude Opus 4.6 谁更强
开源项目 ai-coding-benchmark-zyt 定位为 AI 编程模型对比测试工具,聚焦 GPT-5.3 Codex 与 Claude Opus 4.6 的横向评测。本文解析 AI 编程基准测试的价值、方法论与开发者选型建议。

Sam Altman:OpenAI短期内IPO是"不明智"之举
OpenAI CEO Sam Altman在《财富》采访中表示,近期推动OpenAI上市是"不明智"的决定,同时谈及递归自我改进、AI失控风险与Hugging Face黑客事件,透露公司战略与安全治理立场。

三大模型地缘政治偏见对比:GPT-5.2、Claude、Qwen实测
一个开源项目对比GPT-5.2、Claude Opus 4.6和Qwen 3.5 Plus在希腊敏感地缘政治话题上的偏见表现。本文解析该项目的评测思路、现状局限及大模型中立性审计的现实意义。