共 168 篇相关文章

智谱GLM-5.3基于743B基座发布,编程能力提升50%并承诺开源权重;谷歌Gemini 3.7 Flash编码能力大幅跃进且价格减半;DeepSeek V4 Pro 0813发布不到24小时即撤回;OpenAI推出UltraFast API与Computer History功能。

千问3.8 27B模型本地部署实测,4bit量化塞进24GB显卡,SGLang推理框架避坑指南,编程、长程任务、剧本拆解全面测试,SWE-bench Pro分数超越Claude Opus,个人可用的本地长程编程模型首次成为现实。

深度实测Meta开源模型Muse Glimmer 30B的智能体代理能力、编程表现与本地部署方案。对比Qwen 3.6 27B,解析基准测试数据、硬件配置建议及适用场景,助你选择最适合的本地AI模型。

深入分析AI在软件测试落地中的三大真实痛点——输出随机性、Token成本和执行效率,详解「AI生成+代码执行」的主流方案思路,帮助测试人员选对性价比最高的AI落地方案,应对行业变革。

Meta Muse Glimmer 30B实测评测,296亿参数稠密模型采用Apache 2.0开源协议,视觉理解能力出色,支持128K上下文,24GB显存即可本地运行。详解基准测试、多模态识别表现与局限。

英伟达推出Nemotron系列开源MoE模型,采用混合专家架构实现稀疏激活,可在笔记本电脑或DGX Spark本地高效运行。本文解析MoE架构原理、本地部署优势及Nemotron从轻量本地到云端Ultra的分层策略。

实测Meta开源30B模型Muse Glimmer,覆盖视觉识别、逻辑推理、全栈应用等场景。视觉能力出色但逻辑薄弱,D-Spark加速提速3倍却牺牲质量,128K上下文成最大硬伤。详细部署方案与横评数据。

英伟达Nemotron 3.5 Lightning、Meta Muse Glimmer、阿里千问3.8三款开源大模型同周发布。本文对比三者在速度、智能指数、本地部署等维度的表现,帮你选出最适合本地Agent的模型。

Meta发布开源多模态模型Muse Glimmer,30B参数支持24GB显存单卡运行,Apache 2.0许可证。实测RTX 5090推测解码达233 tokens/秒,支持128K上下文、图像理解与前端代码生成,附带GGUF格式开箱即用。

详解如何用Cloud Code等AI编程Agent生成网站代码,并通过Docker容器化、VPS服务器部署、Certbot配置HTTPS证书,完成从localhost到生产环境上线的完整DevOps流程。

解析开发者对Ollama Cloud上线Qwen3-Max的强烈需求,探讨本地推理工具向云端延伸的趋势、中国大模型全球化进程,以及开发者使用Qwen3-Max的实用部署路径。

Reddit热议Gemini 3.5 Flash在电子表格和文档处理任务上被严重低估,新基准测试验证了用户的真实体验。本文分析Gemini在文档处理上的技术优势,包括超长上下文窗口和多模态设计,并探讨AI模型选型应回归实际场景。

深入解析PagedAttention如何借鉴操作系统分页机制优化GPU显存管理,消除KV Cache碎片化问题,并探讨模型路由在多模型推理服务中的智能调度策略,助力大模型推理系统提升吞吐量与降低成本。

谷歌公开SDK中被发现含有Gemini 4 Flash引用,引发开发者社区对下一代模型的猜测。本文分析SDK泄露的可信度、谷歌Flash系列产品策略,以及如何理性解读此类未经证实的爆料。

中国大模型集体登顶OpenRouter周使用量排行榜,DeepSeek、Qwen、Kimi等开源模型凭借极致性价比和技术突破赢得全球开发者青睐,深度解析霸榜背后的原因与行业启示。

混合专家模型(MoE)让单一参数量指标失效。本文解释总参数与激活参数的区别,帮助你理解MoE架构如何解耦知识容量与推理成本,以及为何这对模型选择至关重要。

深入解析阿里通义千问旗舰模型Qwen3-Max的核心能力,包括代码生成、Cowork协作机制及其在软件开发场景中的应用潜力,帮助开发者了解这款模型的真实定位与价值。

深入解析AI大模型领域六大核心议题:开源与闭源模型之争、推理吞吐量与精度权衡、基准测试刷榜问题、蒸馏与强化学习路径、奖励黑客防御策略,以及动态量化技术如何通过软件优化释放硬件潜力。