共 372 篇相关文章

OpenAI宣布不再推荐SWE-Bench Pro作为AI编程评测基准,折射出数据污染、指标局限等深层问题。本文深入解析AI代码生成能力评测的信任危机成因,以及动态测试、质量评估等新一代评测范式的发展趋势。

千问3.8 27B模型本地部署实测,4bit量化塞进24GB显卡,SGLang推理框架避坑指南,编程、长程任务、剧本拆解全面测试,SWE-bench Pro分数超越Claude Opus,个人可用的本地长程编程模型首次成为现实。

深度实测Meta开源模型Muse Glimmer 30B的智能体代理能力、编程表现与本地部署方案。对比Qwen 3.6 27B,解析基准测试数据、硬件配置建议及适用场景,助你选择最适合的本地AI模型。

DeepSeek-V4-Pro正式发布,带来Agent智能体能力重大升级、弹性推理强度机制及OpenAI Responses API原生兼容。本文详细解析V4-Pro在生产环境落地、成本控制与开发者生态方面的核心改进。

Z.ai发布GLM-5.3大模型,通过大规模后训练扩展在同一底座上实现编程能力跃迁,在智能体编程任务上达到开源SOTA水平,并在漏洞发现与网络防御领域展现涌现能力。深度解析其技术路线与行业意义。

ChatGPT在过去一年损失22个百分点的网络市场份额,Google Gemini、Claude、Perplexity等竞品快速崛起。本文深入分析份额下降的真实原因、数据解读误区及对OpenAI的战略影响。

Meta Muse Glimmer 30B实测评测,296亿参数稠密模型采用Apache 2.0开源协议,视觉理解能力出色,支持128K上下文,24GB显存即可本地运行。详解基准测试、多模态识别表现与局限。

AI编程助手正在改变开发者的角色定位。本文探讨与AI协作编程如何从代码执行转变为任务管理,以及开发者需要培养哪些新的核心技能来适应这种工作范式转变。

深入解析 Cursor 这款 AI 原生编程工具的核心特性,包括智能代码生成、上下文感知、多模型支持等功能,对比传统 IDE 的关键差异,帮助从零基础到资深开发者快速上手 AI 编程。

Bullet是一款主打速度的编程智能体,通过并行化处理、智能模型选择和定向代码搜索,实现比Claude Code和Codex快30%-60%的效率提升。SWE-bench得分95.8%位列前三,支持复用现有订阅和本地模型。

深度解析AI编程工具Harness之争:CloudCode、OpenCode、Pi等编程外壳在速度、Token消耗、模型自由度和成本上的全面对比,揭示同一模型为何性能差异达4倍。

DeepSeek官方开源awesome-deepseek-agent资源仓库,汇集Agent开发框架、工具链与应用案例,已获5500+Star。本文解读这份官方精选库的定位、收录内容及其对Agent开发者的实际价值。

DeepSWE基准测试显示Gemini 3.7 Flash编程能力超越Opus 4.8,且成本仅为七分之一、速度快6倍。深入分析小模型逆袭现象及对开发者模型选择策略的实际启示。

深入剖析AI Agent的内部构造与工作原理,从感知-推理-行动闭环、工具调用、上下文管理到错误处理,揭示智能体的真实运作机制与工程挑战,帮助开发者理解Agent的能力边界。

深度实测Meta开源Muse-Glimmer-30B模型,九大维度403道题综合均分76.04,工具调用90+分碾压同级。4bit量化几乎无损,24G显存轻松驱动,D-Flash加速3.1倍达233tokens/秒,是本地部署玩家的高性价比首选。

来自Superconductor团队的多人协作智能体工程方法论,涵盖模型中立、云端隔离、信号自动化、团队可见性等6条实践经验,帮助团队高效整合AI智能体到日常工作流。

Meta开源Muse-Glimmer-30B稠密模型,专为Agent场景设计,支持工具调用与多模态理解。采用Apache协议,部分指标超越Qwen-3 27B,本文详解其性能表现、硬件需求与部署方案。

深度解析GLM-5.3模型的前沿编码能力与涌现网络安全能力,探讨其在软件工程、漏洞发现、安全审计等领域的应用潜力,以及社区对安全治理与滥用风险的讨论。