共 1 篇相关文章
从OpenClaw 35万Star项目中选取3个真实PR,让GLM、DeepSeek、Kimi等7个AI模型独立修Bug。GLM 5.1以89.3分反超Sonnet 4.6的87.2分,测试覆盖碾压全场,国产开源AI编程能力已追上Claude Sonnet基准线。