共 504 篇相关文章

实测Qwen3 27B开源模型在单张RTX 3090上的表现,涵盖推理速度、Agent能力、多模态视觉及工具调用等维度,对比DeepSeek V-Flash等闭源模型,解析其性价比优势与本地部署方案。

DeepSeek V4-Pro正式上线,Agent能力大幅升级,推理力度三档可调,原生支持OpenAI Responses API。本文深度解读V4-Pro跑分数据、与V4-Flash对比、DS Bench内部榜单表现,以及8月17日API分时涨价策略详情。

DeepSeek-V4-Pro正式发布,带来Agent智能体能力重大升级、弹性推理强度机制及OpenAI Responses API原生兼容。本文详细解析V4-Pro在生产环境落地、成本控制与开发者生态方面的核心改进。

Meta开源Muse-Glimmer-30B稠密模型,专为Agent场景设计,支持工具调用与多模态理解。采用Apache协议,部分指标超越Qwen-3 27B,本文详解其性能表现、硬件需求与部署方案。

GPT-5.6 SoulX High版本在前端开发榜以1636分登顶,Agent Arena排名第二。通过个人作品集网页和推理小游戏两组实测,深入分析其任务拆解、连续执行与自我纠错的Agent能力表现。

一位开发者获得GPT-5.6早期访问权,历时一个半月、横跨67个项目、消耗约20万美元推理成本进行极限实测。本文详解其在代码重构、React Native重写、GRUB引导修复等真实工程场景中的表现,客观评估GPT-5.6的Agent能力质变与前端短板。

深度实测阿里开源网页自动化工具PageAgent:三种接入方式详解、脚本执行能力解析、当前局限性全面梳理。一行JS代码即可为网页赋予AI Agent能力,适合自动化测试与智能导航场景,开发者快速入门指南。

Anthropic正式发布Claude Sonnet 5,官方称其为最具代理能力的Sonnet模型。新模型支持规划任务、调用浏览器与终端工具、自主运行,将旗舰级Agent能力带入中端价位,大幅降低开发者构建AI自动化应用的成本门槛。

CueBench for Developers是首个评估「人类如何驱动编程Agent」的基准测试工具,区别于传统SWE-bench等模型评估,它将焦点转向开发者的提示质量、任务拆解与迭代反馈能力,帮助开发者建立AI协作的反馈循环,量化人机协作时代的核心竞争力。
社区热议·第1期:AI Agent能力跃升与信任危机
每周四聊聊Twitter和Reddit上本周最火的AI话题

Perplexity宣布将Deep Research整合为Computer的原生技能,用户无需手动切换模式即可自动调用深度研究能力。本文解析这一Agent Harness设计哲学的意义,对比ChatGPT、Gemini等竞品路径差异,探讨AI Agent能力无缝融合的行业趋势。
教程攻略深入解析Agent Tuning的原理与实践,包括为什么需要Agent训练、从Prompt到RAG到Agent的技术演进、研发流程与成本评估,帮助中小模型获得顶级Agent能力实现私有化部署。
产品体验深度评测Kimi K2.6模型的编程工程能力、群智Agent协作与视觉开发表现。SWE-Bench Pro开源第一,支持300个并行子代理协作,API价格仅为竞品三分之一,全面拆解其架构优势与实际落地价值。
科技前沿深度解析谷歌Gemini 3.5 Flash的三大核心能力:Agent智能体自主执行、不到一分钟视频生成、76.2%编码得分。对比GPT与豆包,帮你找到最适合的AI生产力工具。
观点碰撞Replit CEO Amjad Masad深度访谈解读:AI Agent从2分钟到200分钟的长程推理突破,自然语言编程的实现,可验证性如何决定AI进步速度,以及为什么当前AI的实用性反而成为AGI的最大障碍。
产品体验深度解读GPT-5.5核心升级:从聊天助手进化为超级执行者,20分钟完成数小时编程工作,知识工作全流程自动化,基准测试全面领先。详解三大版本定价、API费用及安全策略。

DeepSeek Harness是GitHub史上增长最快的开源Agent框架,48小时斩获9.5万星。本文深度解析其MIT开源协议、插件化乐高架构、一行命令上手的核心优势,以及与Claude Code的路线之争。

DeepSeek开源智能体框架Harness,12小时GitHub狂揽5万星标;Claude攻克黎曼猜想相关难题;OpenAI晶圆级芯片推理提速14倍。AI竞争主战场正从模型能力向智能体框架和底层基础设施全面扩散。