共 25 篇相关文章

Reddit 用户实测反馈 Gemma 4:31b 在 Ollama 上的最新表现:工具调用不再频繁失败,乱码输出问题消失。深入分析本地大模型稳定性提升的技术原因与实际意义。
产品体验实测Google Gemma 4开源模型在三台手机上的离线运行表现,详解Dense与MOE架构区别,附Ollama + Claude Code完整部署教程。从1B到31B四款模型覆盖手机到工作站全场景,4GB显存即可运行。

详解如何利用闲置废旧硬件搭建本地AI推理平台,涵盖硬件选型、显存需求、推理框架选择(llama.cpp/Ollama)、模型量化等关键环节,低成本实现隐私安全的本地大模型部署。

深度实测DeepSeek Harness开发者预览版,解析其一切皆插件的模块化架构、完全透明的可追踪机制、Creator Mode对话式插件开发,以及灵活的多模型接入能力,探讨其与Claude Code的差异化路线。

阿里通义千问Qwen 3.8 27B以开放权重形式发布,被誉为目前最好的本地部署稠密模型。本文解析其技术定位、27B参数量优势、开放权重的战略意义及社区评价。

详解如何零成本搭建科研Agent,利用免费模型+本地Qwen3.5-4B+LaTeX工具链,实现自动文献检索、数据分析、图表绘制与论文撰写,20分钟跑完一篇完整论文,适合预算有限的研究生群体。

详解Windows系统本地部署Dify的完整流程,涵盖WSL启用、Docker Desktop安装配置国内镜像、.env文件生成、Ollama本地模型连接,以及数据库连接失败的解决方案。

实测AMD Radeon 840M核显利用32GB统一内存运行Gemma 26B-A4B大模型,达到17 tok/s生成速度。深入解析Ollama在统一内存架构下的GPU/CPU占比误读、mmap性能瓶颈及优化方案,为APU用户提供本地大模型部署实用建议。

详解Ollama API Key Proxy开源项目,通过反向代理实现多API密钥轮询轮换、429自动冷却、智能重试,解决云端大模型速率限制问题,提升AI编程工具工作流稳定性。

阿里Qwen3 Max预览版完成重要迭代,前端代码生成质量显著提升,智能体工具调用更稳定可靠。本文基于PinBench实测数据,深度解析2.4万亿参数旗舰模型的核心改进、性能表现及免费使用方式。

手把手教你用Ollama+Dify搭建本地企业级RAG知识库,涵盖模型安装、IP监听配置、自定义微调模型导入、Embedding向量检索全流程,彻底摆脱云端API依赖,保障数据安全。

通过 Ollama 开源方案,将 Claude Code 等 AI 编程工具指向本地运行的开源模型,解锁 DeepSeek、Qwen3、Gemma 等数百个模型,在保持原有工作流不变的前提下,将 API 使用成本降至接近于零。本文详解配置方法、硬件要求与竞品对比。
llmfit:一条命令检测硬件能跑哪些本地大模型
llmfit 是用 Rust 编写的开源命令行工具,无需下载模型即可预判本地硬件能否运行指定 LLM。覆盖数百种模型与 Ollama、llama.cpp 等主流推理后端,帮助开发者在本地部署大模型前快速完成硬件适配评估,避免反复试错。

一张二手RTX 3090,一个16.8GB的GGUF文件,Qwen3.6 27B即可本地离线运行。SWE-bench得分77分媲美Claude Sonnet,MTP技术让推理速度提升至59 token/s。无订阅、无云端、数据不出门,本地AI编程助手完整部署指南。

ComfyUI MCP开源项目借助Anthropic MCP协议,让Claude等大模型直接操控ComfyUI节点图,实现自然语言描述需求、AI自动搭建工作流、本地GPU渲染全流程。告别繁琐节点操作,零点击完成AI图像生成。

深度实测AMD Ryzen AI Halo迷你AI盒子:搭载Ryzen AI Max Plus 395(Strix Halo)芯片,128GB统一内存,售价4000美元。对比英伟达DGX Spark,从Token生成、预填充速度到x86架构优势,全面解析谁更值得入手。

本文系统讲解CrewAI核心概念(Agent、Task、Process、Crew、Pipeline),并演示如何结合FastAPI封装多Agent协作服务。涵盖GPT、通义千问、Ollama本地模型三种接入方案及实测对比,助你快速上手多智能体应用开发。

Google Android Bench基准测试显示,开源前沿模型已能解决50%-60%的Android开发任务,Gemma 4等中等规模模型仅需20GB RAM即可本地运行,本地AI辅助Android开发正式成为可行方案。