共 12 篇相关文章

深度解析DeepSWE编程基准测试如何揭露SWE-Bench Pro的数据污染和作弊问题。GPT-5.5以70%通过率领先,开源模型差距明显。涵盖测试结果、成本对比与开发者实用建议。

DeepSWE长周期软件工程基准测试显示GPT 5.5以70%通过率领先Opus 4.7超15个百分点,且成本仅为其三分之一。深度解析DeepSWE的无污染验证机制、模型行为差异及对AI编程格局的影响。

DeepSeek V4-Pro正式上线,Agent能力大幅升级,推理力度三档可调,原生支持OpenAI Responses API。本文深度解读V4-Pro跑分数据、与V4-Flash对比、DS Bench内部榜单表现,以及8月17日API分时涨价策略详情。

DeepSeek V4 Pro、Grok 4.6、腾讯混元WorldCloud、阿里万亿开源模型同日发布,Agent能力成主战场,价格战全面开打。深度解析四大发布的核心亮点与产业趋势。

智谱GLM-5.3基于743B基座发布,编程能力提升50%并承诺开源权重;谷歌Gemini 3.7 Flash编码能力大幅跃进且价格减半;DeepSeek V4 Pro 0813发布不到24小时即撤回;OpenAI推出UltraFast API与Computer History功能。

DeepSWE基准测试显示Gemini 3.7 Flash编程能力超越Opus 4.8,且成本仅为七分之一、速度快6倍。深入分析小模型逆袭现象及对开发者模型选择策略的实际启示。

Poolside 发布开源智能体编程模型 Laguna S 2.1,118B总参数仅激活8B,DeepSWE基准得分40.4%,超越DeepSeek V4 Pro Max约4.5倍。支持百万Token上下文,单台工作站可部署,OpenRouter定价$0.10/百万Token起,256K上下文端点免费。

GPT-5.6正式开放,一次推出Sol、Terra、Luna三款模型。本文结合权威基准数据与真实用户反馈,深度解析三款模型的性能差异、强项弱点,并给出清晰的选型建议,帮你找到最适合自己的那一款。

GPT-5.6(Sol)能力强大却极耗额度?本文整理推理档位选择、Fast Mode开关、Prompt停止点设计等核心技巧,帮你在不撞限额的前提下充分发挥Codex潜力。

实测GPT-5.6 Sol模型:单条Prompt自动生成实时语音动漫角色、从零手写物理引擎、自主搭建陌生工具链。深度评测编程能力、智能体任务表现及基准数据对比,解析其性价比优势与幻觉率短板。

OpenAI发布GPT-5.6系列(Sol/Terra/Luna),旗舰模型Sol直接完成小模型Luna的后训练,标志AI递归自我改进进入实践阶段。本文深度解析三款模型性能对比、成本优势、ChatGPT Work新应用及computer use设计能力的显著跃迁。

开放权重≠能本地运行。本文深度拆解GLM 5.2、DeepSeek等大模型的硬件门槛、显存瓶颈、电费成本与并行限制,揭示开源大模型真正的价值:推动云端竞争,而非让普通人在家复刻前沿效果。