基准
PerfReasoning
一个专门评估大语言模型硬件性能推理能力的基准测试,从问答推理和分析性性能模型代码生成两个维度评估LLM在芯片架构、数据流映射等性能建模任务上的能力
时间轴 (近 90 天)
9月11日
PerfReasoning是一个用于评估LLM硬件性能推理能力的基准测试,通过arXiv论文发布
待验证50%
9月11日
PerfReasoning从两个层面评估LLM:作为直接性能推理者,以及作为分析性性能模型代码的生成者
待验证50%
9月11日
作为直接性能推理者,模型需给定工作负载、架构和映射规格,比较不同映射方案并预测片外访存流量和缓冲区需求
待验证50%
9月11日
在基于推理的问答任务上,最强的闭源模型准确率超过90%
待验证50%
9月11日
在性能模型代码构建任务上,GPT-5.6 Sol通过率超过80%
待验证50%
9月11日
在性能模型代码构建任务上,除GPT-5.6 Sol外的其他所有模型配置平均通过率低于15%,且多次运行之间波动极大
待验证50%
9月11日
LLM能够做出看似合理的架构推理,但在可靠地构建性能模型上存在巨大鸿沟
待验证50%
9月11日
研究团队表示将公开发布PerfReasoning基准以支持可复现的评估
待验证50%
全部知识事实 (8)
待验证
LLM能够做出看似合理的架构推理,但在可靠地构建性能模型上存在巨大鸿沟
50%待验证PerfReasoning从两个层面评估LLM:作为直接性能推理者,以及作为分析性性能模型代码的生成者
50%待验证作为直接性能推理者,模型需给定工作负载、架构和映射规格,比较不同映射方案并预测片外访存流量和缓冲区需求
50%待验证在基于推理的问答任务上,最强的闭源模型准确率超过90%
50%待验证在性能模型代码构建任务上,GPT-5.6 Sol通过率超过80%
50%待验证在性能模型代码构建任务上,除GPT-5.6 Sol外的其他所有模型配置平均通过率低于15%,且多次运行之间波动极大
50%待验证研究团队表示将公开发布PerfReasoning基准以支持可复现的评估
50%待验证PerfReasoning是一个用于评估LLM硬件性能推理能力的基准测试,通过arXiv论文发布
50%