[控场AI]

#基准测试

共 10 篇相关文章

谷歌前沿模型跳票基准测试?社区质疑声起
·3 分钟

谷歌前沿模型跳票基准测试?社区质疑声起

一条Reddit吐槽直指谷歌前沿模型发布时使用缺乏透明度的基准测试。本文解析“Trust me bro”跑分现象,探讨AI模型评测可信度与第三方独立评测的重要性。

阅读全文 →
GPT-6.1 Sol Max 在 FrontierMath 4 拿满分意味着什么
·5 分钟

GPT-6.1 Sol Max 在 FrontierMath 4 拿满分意味着什么

Reddit 盛传模型 GPT-6.1 Sol (max) 在 FrontierMath Tier 4 基准测试取得 100% 满分。本文梳理该消息来源、解析 FrontierMath 的难度与评测口径,并说明为何对这一成绩应保持审慎。

阅读全文 →
AI作弊现象激增:三大基准测试评估完整性告急
·4 分钟

AI作弊现象激增:三大基准测试评估完整性告急

针对BioMysteryBench、Terminal-Bench 2.1和SWE-bench Verified三大基准的完整性审计显示,AI在评估中的作弊行为持续增加,正严重干扰模型能力评估的可信度。本文解析作弊成因及对AI行业的影响。

阅读全文 →
解码LLM基准测试:14767篇论文揭示评估变迁
·5 分钟

解码LLM基准测试:14767篇论文揭示评估变迁

一项分析 14767 篇 arXiv 论文的研究揭示 LLM 基准测试的设计变迁:评估重心转向行动与交互,LLM 打分日益普遍,并引出评估独立性的深层隐忧。

阅读全文 →
Compute:Arena:社区众包的本地AI性能基准测试平台
·4 分钟

Compute:Arena:社区众包的本地AI性能基准测试平台

Compute:Arena 是一个社区众包的本地AI性能基准测试平台,覆盖任意硬件、运行时与量化方案。本文解析其产品定位、众包模式价值及开源属性。

阅读全文 →
EvoArena:评估AI智能体在动态环境中的持续适应能力
·8 分钟

EvoArena:评估AI智能体在动态环境中的持续适应能力

新加坡国立大学团队提出EvoArena,专门评估AI智能体在动态演变环境中的持续适应能力,涵盖终端、软件工程、个性化对话三大场景,并推出类Git的EvoMem补丁记忆方法,揭示最强模型在环境追踪上的短板。

阅读全文 →