LiveNerf
由社区开发者创建的开源持续监测基准项目,通过每日重复运行GPQA和SWE-bench等测试并绘制能力曲线,用于追踪大语言模型是否随时间发生能力下滑
时间轴 (近 90 天)
LiveNerf 由开发者 ninjahawk 发起,代码托管在 GitHub 仓库 ninjahawk/livenerf
截至第8天更新,LiveNerf 仓库 star 数接近 1000,并登上了 Hacker News 首页
LiveNerf 在第8天更新时正接近建立性能基线(baseline)的阶段
LiveNerf 项目的作者持中立立场,并非基于'Opus 5.5 会变差'的假设运行,即使数据显示没有性能退化也被视为有价值的结论
截至文章发布,LiveNerf 仍处于数据收集阶段,尚未给出关于 Opus 5.5 是否被降级的结论
Livenerf 是一个开源项目,用于持续追踪监测Claude Opus模型是否被削弱(nerf/降智)
作者表示需要到第10天才能建立起可靠的基线,在第20天之前不会做出任何正式判断
一位Reddit开发者推出了名为LiveNerf的开源基准项目,从模型发布第一天起持续追踪Opus 5.5的表现
用Claude来挑选最难题目本身可能引入选择性偏差,是LiveNerf项目的方法论局限之一
LiveNerf每天重新运行一批独立基准测试,例如GPQA和SWE-bench,并将结果绘制成图表记录在GitHub仓库中
还有 4 条时间轴事件
全部知识事实 (14)
截至文章发布,LiveNerf 仍处于数据收集阶段,尚未给出关于 Opus 5.5 是否被降级的结论
50%待验证LiveNerf 由开发者 ninjahawk 发起,代码托管在 GitHub 仓库 ninjahawk/livenerf
50%待验证截至第8天更新,LiveNerf 仓库 star 数接近 1000,并登上了 Hacker News 首页
50%待验证LiveNerf 项目的作者持中立立场,并非基于'Opus 5.5 会变差'的假设运行,即使数据显示没有性能退化也被视为有价值的结论
50%待验证Livenerf 是一个开源项目,用于持续追踪监测Claude Opus模型是否被削弱(nerf/降智)
50%待验证截至作者发帖时,LiveNerf监测结果显示Opus 5.5尚未检测到任何nerf(削弱)迹象
50%待验证作者表示需要到第10天才能建立起可靠的基线,在第20天之前不会做出任何正式判断
50%待验证用Claude来挑选最难题目本身可能引入选择性偏差,是LiveNerf项目的方法论局限之一
50%待验证LiveNerf每天重新运行一批独立基准测试,例如GPQA和SWE-bench,并将结果绘制成图表记录在GitHub仓库中
50%待验证LiveNerf作者借助Claude来筛选出Opus 5.5最容易出错的那部分题目进行测试
50%待验证LiveNerf使用上一代的Opus 5作为对照基准
50%待验证LiveNerf的判定标准是:如果Opus 5.5得分偏离超过7.5分,就被视为潜在的能力下降信号
50%待验证LiveNerf 在第8天更新时正接近建立性能基线(baseline)的阶段
50%待验证一位Reddit开发者推出了名为LiveNerf的开源基准项目,从模型发布第一天起持续追踪Opus 5.5的表现
50%