共 284 篇相关文章

详细讲解Ollama本地部署大模型的完整流程,包括安装配置、模型下载管理、上下文长度调优实测,以及接入DeepSeek Harness等智能体工具的方法,帮助新手零成本运行本地AI大模型。

深度实测DeepSeek Harness开发者预览版,解析其一切皆插件的模块化架构、完全透明的可追踪机制、Creator Mode对话式插件开发,以及灵活的多模型接入能力,探讨其与Claude Code的差异化路线。

Unsloth Desktop发布重大更新,新增实验性自动压缩功能解决长对话上下文管理难题,支持LAN与远程访问,合并超200个PR提升性能体验。详解混合RAG压缩策略与本地大模型部署新能力。

Unsloth发布Dynamic v3量化方案,Qwen3.8-27B GGUF模型在同体积下实现10% top-1%精度提升,并推出6-8GB的1-bit极限量化版本。新增Divergence-300长序列评测指标,更真实反映量化质量。

Qwen3.8-27B成为Unsloth社区使用量最高的开源模型,远超DeepSeek-R1和Qwen3.6-35B-A3B。27B参数量化后可在消费级显卡本地部署,成为开发者首选基座模型。深度解析其爆火原因与开源生态趋势。

Agents Never Sleep 是一款macOS菜单栏工具,让MacBook合盖后AI Agent仍能持续运行。本文解析其核心功能、使用场景、与Caffeine等工具的差异,以及合盖运行的散热与电量注意事项。

深入解析自托管AI软件工厂的概念、技术架构与落地实践。涵盖本地大模型部署、Agent工作流编排、数据隐私保障等核心要素,帮助开发团队构建自主可控的AI驱动开发流水线。

Meta超级智能实验室开源Muse Glimmer 30B多模态Agent模型,采用4-bit量化、混合注意力和D-Flash投机解码三大技术,可在RTX 4090等消费级显卡上运行,Agent基准测试大幅领先同级模型。

海外博主系统实测Qwen3 27B量化版本地部署表现,覆盖256K长上下文记忆、HumanEval编程、MCP工具链等维度。RTX A2000仅16GB显存即可运行,代码生成质量超越同级所有本地模型。

详解单张RTX 4090部署Qwen3 27B Q4量化模型的完整方案,涵盖显存计算、K8V4非对称KV Cache量化、128K上下文配置、生成速度分析及AI编程工具实战调优经验。
大佬观点·第5期:OpenAI暂停RL训练、ChatGPT记住你的一切与Pe…
每周五盘点本周行业大佬的发言和官方公告

实测Qwen3.8-27B在24GB M4 Pro Mac mini上的运行表现,详解GPU显存上限调整、KV缓存量化、关闭思考模式三个关键设置,附IQ4_XS与Q4_K_M量化对比数据,帮助你在有限内存中稳定运行27B稠密模型。

一位开发者取消商业AI代码审查订阅,自建本地运行的免费替代工具。本文解析本地AI代码审查的隐私优势、成本控制策略,以及基于开源大模型搭建本地代码审查工具的可行性与权衡。

Qwen通义千问开发者暗示用户不必等待35B-A3B模型,社区猜测可能有更大规模MoE模型发布或产品线策略调整。本文解读命名规则、分析三种可能方向及对开源大模型生态的影响。
赚钱实战·第8期:不会编程也能用AI Agent做工具赚钱的五条路
每周三分享至少5个用AI赚钱的实战思路,逻辑清晰可执行

omlx是一款专为Apple Silicon优化的开源LLM推理服务器,支持连续批处理、SSD缓存和macOS菜单栏管理。本文深入解析其核心技术亮点、适用场景及与Ollama等工具的差异化竞争优势。

实测llama.cpp图形化启动器Linux版,对比手动编译与Snap两种安装方式的优劣,涵盖启动命令差异、已知Bug及与Ollama和LM Studio的定位区别,助你快速在Linux上部署本地大模型。

每月100美元AI预算,是全押ChatGPT Pro还是组合ChatGPT Plus、Cursor Pro、SuperGrok?本文从开发者与通用用户视角,深度对比单一订阅与组合方案的优劣,帮你找到最适合的AI工具订阅策略。