待验证50% 置信基准精确时间
在Agency工具调用测试中两款模型均得95分,唯一失败的都是第13号任务(美元到日元外币转换)
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/9
首次发现
有效期至:2026/10/7
来源
16G显存实测:Ornith 35B vs Qwen 35B全方位对决
bilibili程序员-智能译站2026/7/7
相关事实
待验证Devin 2.0在SWE-bench基准测试中解决了13.86%的实际编程问题,而此前的AI模型仅为1.96%67% 相似待验证在256K上下文的大海捞针测试中,两款模型表现完全一致,均取得93%的成绩,仅在100%满上下文深度时各有一次失败63% 相似待验证在PlanBench的神秘方块世界测试中,2023年的模型几乎完全失败,但O1等推理模型的出现带来了显著改善61% 相似待验证OpenAI的图表显示,在较低的测试时计算量下,模型对这道题的成功率接近零,只有在极长的推理链条下才偶尔成功61% 相似待验证测试数据表明RNN头与马尔可夫头的草稿通过率差距仅在1-2%以内,而部署成本差距可达数倍60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/342894API
curl https://kongchang.com/api/v1/knowledge/claims/342894MCP
get_claim(id=342894)