[控场AI]
基准

PerfReasoning

一个专门评估大语言模型硬件性能推理能力的基准测试,从问答推理和分析性性能模型代码生成两个维度评估LLM在芯片架构、数据流映射等性能建模任务上的能力

时间轴 (近 90 天)

9月11日

PerfReasoning是一个用于评估LLM硬件性能推理能力的基准测试,通过arXiv论文发布

待验证50%
9月11日

PerfReasoning从两个层面评估LLM:作为直接性能推理者,以及作为分析性性能模型代码的生成者

待验证50%
9月11日

作为直接性能推理者,模型需给定工作负载、架构和映射规格,比较不同映射方案并预测片外访存流量和缓冲区需求

待验证50%
9月11日

在基于推理的问答任务上,最强的闭源模型准确率超过90%

待验证50%
9月11日

在性能模型代码构建任务上,GPT-5.6 Sol通过率超过80%

待验证50%
9月11日

在性能模型代码构建任务上,除GPT-5.6 Sol外的其他所有模型配置平均通过率低于15%,且多次运行之间波动极大

待验证50%
9月11日

LLM能够做出看似合理的架构推理,但在可靠地构建性能模型上存在巨大鸿沟

待验证50%
9月11日

研究团队表示将公开发布PerfReasoning基准以支持可复现的评估

待验证50%

全部知识事实 (8)

来源文章