共 2 篇相关文章
Anthropic发布重磅研究报告,揭示AI递归自我改进的最新进展:Claude代码贡献超80%、训练优化达52倍加速、研究判断力在64%的决策点优于人类。深度解读实验数据与局限性。
Anthropic最新模型Claude Mythos Preview在METR基准测试中表现惊人,80%成功率下时间跨度超过次优模型2倍以上,标志着AI Agent能力实现质的飞跃。本文深度解读METR评测指标及其对AI行业竞争格局的影响。