共 139 篇相关文章

深入解析LLM推理的Prefill与Decode两阶段特性,探讨CPU在解码阶段的内存带宽优势,以及CPU-GPU异构混合推理架构如何降低成本、提升资源利用率。

深入剖析vLLM高吞吐推理引擎的核心架构,详解PagedAttention分页机制、KV Cache内存管理、连续批处理调度策略,解读vLLM如何将显存利用率提升至96%以上并实现数倍吞吐量提升。

深度解析阿里巴巴通义千问Qwen3系列最新动态,探讨其在多模态视觉理解、中文能力、开源生态等方面的核心优势,以及对开发者和行业的深远影响。

Homebench是一款开源的本地大模型评测工具,从速度、内存占用和输出质量三个维度综合评估LLM在本地硬件上的真实表现,帮助开发者做出最优的模型选型和量化方案决策。

面向零基础开发者的本地AI模型部署指南,涵盖从Hugging Face安全下载模型、运行推理、导出GGUF格式并通过llama.cpp高性能本地运行的完整流程,附开源Python脚本实践。

Unsloth正式支持AMD GPU平台,覆盖RDNA 3-4、Strix Halo及MI300等全线硬件,在500+模型上实现2倍训练加速和70%显存节省,支持强化学习、vLLM权重共享,兼容Windows/Linux/WSL三大系统。

Poolside宣布Laguna S 2.1重大服务升级,速率限制提升10倍,OpenRouter日处理量达2500亿Token。支持1M上下文窗口专用部署,已集成cline、opencode等主流AI编程Agent工具,适用于高并发自主工作流场景。

Mistral发布Shieldstral开源多模态内容审核模型,仅30亿参数即可实现文本与图像安全检测。本文详解其核心特性、应用场景及与Llama Guard等竞品的对比,助力开发者构建低成本AI安全护栏。

Quantprobe是一个开源内存分配优化框架,通过逐层量化布局和智能CPU/GPU拆分,让6GB显存的老显卡以22 tokens/s速度运行30B参数大模型,大幅降低本地LLM部署的硬件门槛。

Zen Whisper是一款完全本地化的Mac语音输入工具,基于Whisper模型实现离线语音转文字,音频数据不离开设备。支持随处输入、语音备忘、媒体转录等功能,适合重视隐私的Mac用户。

深入解析如何在Mac上仅用4.3GB内存运行80B参数大模型的技术原理,涵盖超低比特量化、稀疏化、内存映射等关键技术,探讨本地大模型部署对隐私保护和边缘AI的深远意义。

深度分析AI产品发布如何引爆开发者社区情绪,解读Reddit、Discord等平台的集体兴奋背后的行业趋势,以及开发者如何从情绪化反应转向理性技术评估的完整框架。

深入解析Token如何从大语言模型的技术概念演变为AI经济的核心计量单位。探讨AI Agent时代Token消耗爆炸、成本优化策略及Token经济学对开发者和投资人的深层影响。

Tomte是一款专为Apple Silicon优化的Gemma模型本地运行框架,免费开箱即用,提供高速推理体验。本文详解其核心功能、性能优势及与ChatGPT的对比,帮助Mac用户实现隐私安全的本地AI部署。

Vao2是一款开源个人信息聚合器,整合新闻、YouTube、GitHub和RSS订阅到单一信息流,通过Ollama本地AI生成内容摘要,兼顾隐私保护与零成本使用,适合重视数据主权的技术用户。

详解如何用AMD RX 7800 XT 16GB显存本地部署大语言模型驱动量化交易机器人,涵盖ROCm生态现状、7B-14B模型推荐(Qwen2.5、Llama 3.1)、Ollama/LM Studio部署方案及系统架构设计。

详解如何将散落的自动化脚本整合为本地AI Agent智能中枢。涵盖Function Calling核心机制、Ollama+Qwen2.5本地部署方案、工具编排架构设计及完整落地路线图,适合独立开发者和小团队。

深入解析持久化状态机与INT4量化内存单元结合重构LLM注意力机制的技术方案,探讨如何突破KV Cache内存瓶颈,实现固定内存下的长上下文推理,覆盖边缘部署、高并发推理等应用场景。

实测双卡RTX 3060加96GB内存运行DeepSeek V4 Flash,IQ2_M量化精度下推理速度达3.5 tokens/秒。详解硬件配置选择、2-bit量化技术原理、实际使用体验及本地大模型部署优化方向。

详解如何用500美元预算搭建多功能家用服务器,涵盖Jellyfin流媒体、Ollama本地AI推理、Web应用托管和Pi-hole广告拦截的硬件选型、双RTX 3060显卡方案及内网穿透部署建议。