[控场AI]
基准

LiveNerf

由社区开发者创建的开源持续监测基准项目,通过每日重复运行GPQA和SWE-bench等测试并绘制能力曲线,用于追踪大语言模型是否随时间发生能力下滑

时间轴 (近 90 天)

10月2日

LiveNerf 由开发者 ninjahawk 发起,代码托管在 GitHub 仓库 ninjahawk/livenerf

待验证50%
10月2日

截至第8天更新,LiveNerf 仓库 star 数接近 1000,并登上了 Hacker News 首页

待验证50%
10月2日

LiveNerf 在第8天更新时正接近建立性能基线(baseline)的阶段

待验证50%
10月2日

LiveNerf 项目的作者持中立立场,并非基于'Opus 5.5 会变差'的假设运行,即使数据显示没有性能退化也被视为有价值的结论

待验证50%
10月2日

截至文章发布,LiveNerf 仍处于数据收集阶段,尚未给出关于 Opus 5.5 是否被降级的结论

待验证50%
9月30日

Livenerf 是一个开源项目,用于持续追踪监测Claude Opus模型是否被削弱(nerf/降智)

待验证50%
9月28日

作者表示需要到第10天才能建立起可靠的基线,在第20天之前不会做出任何正式判断

待验证50%
9月28日

一位Reddit开发者推出了名为LiveNerf的开源基准项目,从模型发布第一天起持续追踪Opus 5.5的表现

待验证50%
9月28日

用Claude来挑选最难题目本身可能引入选择性偏差,是LiveNerf项目的方法论局限之一

待验证50%
9月28日

LiveNerf每天重新运行一批独立基准测试,例如GPQA和SWE-bench,并将结果绘制成图表记录在GitHub仓库中

待验证50%

还有 4 条时间轴事件

全部知识事实 (14)

待验证

截至文章发布,LiveNerf 仍处于数据收集阶段,尚未给出关于 Opus 5.5 是否被降级的结论

50%
待验证

LiveNerf 由开发者 ninjahawk 发起,代码托管在 GitHub 仓库 ninjahawk/livenerf

50%
待验证

截至第8天更新,LiveNerf 仓库 star 数接近 1000,并登上了 Hacker News 首页

50%
待验证

LiveNerf 项目的作者持中立立场,并非基于'Opus 5.5 会变差'的假设运行,即使数据显示没有性能退化也被视为有价值的结论

50%
待验证

Livenerf 是一个开源项目,用于持续追踪监测Claude Opus模型是否被削弱(nerf/降智)

50%
待验证

截至作者发帖时,LiveNerf监测结果显示Opus 5.5尚未检测到任何nerf(削弱)迹象

50%
待验证

作者表示需要到第10天才能建立起可靠的基线,在第20天之前不会做出任何正式判断

50%
待验证

用Claude来挑选最难题目本身可能引入选择性偏差,是LiveNerf项目的方法论局限之一

50%
待验证

LiveNerf每天重新运行一批独立基准测试,例如GPQA和SWE-bench,并将结果绘制成图表记录在GitHub仓库中

50%
待验证

LiveNerf作者借助Claude来筛选出Opus 5.5最容易出错的那部分题目进行测试

50%
待验证

LiveNerf使用上一代的Opus 5作为对照基准

50%
待验证

LiveNerf的判定标准是:如果Opus 5.5得分偏离超过7.5分,就被视为潜在的能力下降信号

50%
待验证

LiveNerf 在第8天更新时正接近建立性能基线(baseline)的阶段

50%
待验证

一位Reddit开发者推出了名为LiveNerf的开源基准项目,从模型发布第一天起持续追踪Opus 5.5的表现

50%

来源文章