共 13 篇相关文章

Chestnut是一款采用开源固件设计的eGPU外置显卡扩展坞,支持开发者自定义固件逻辑。本文深度解析其技术架构、开源优势、适用场景及面临的挑战,适合硬件极客和本地AI开发者关注。


Dograh是一款完全开源的语音AI智能体平台,提供可视化流程构建、30+模型集成、本地部署、电话通信及人工转接等功能,支持一条命令自托管,是VAPI的自由替代方案。

深入探讨如何在macOS虚拟机环境中利用Apple Silicon统一内存架构加速llama.cpp推理,涵盖Metal后端配置、内存分配、量化格式选择等优化策略,帮助开发者在虚拟化环境中实现接近裸机的LLM推理性能。

详解24GB显卡跑本地大语言模型时显存的真实可用量。从模型权重、KV缓存到运行时余量,拆解显存三大消耗桶,提供结构化规划方法和实操建议,帮你避免OOM踩坑。

hotcell是一款开源自托管沙箱SDK,专为AI Agent代码执行安全隔离设计。支持Mac/Linux本地运行,提供默认拒绝出站网络、per-sandbox临时token机制和资源管控,让开发者无需依赖云服务即可实现AI代码的安全执行。

Capacity Desktop是一款运行在Mac本地的免费AI应用生成器,支持自然语言生成真实应用,代码存储在本地并可同步GitHub。无需注册、无平台锁定,按AI实际成本计费。本文详细解析其与Lovable等云端工具的核心差异。

Quantprobe是一个开源内存分配优化框架,通过逐层量化布局和智能CPU/GPU拆分,让6GB显存的老显卡以22 tokens/s速度运行30B参数大模型,大幅降低本地LLM部署的硬件门槛。

详解如何用AMD RX 7800 XT 16GB显存本地部署大语言模型驱动量化交易机器人,涵盖ROCm生态现状、7B-14B模型推荐(Qwen2.5、Llama 3.1)、Ollama/LM Studio部署方案及系统架构设计。
每日AI新鲜事·08月02日午间版:本地跑大模型的瓶颈与突破
2026年08月02日午间版 AI新闻速递+热点深度讨论

RX 9060 XT与RTX 5060 Ti同为16GB显存,本地AI推理该选谁?从CUDA生态、ROCm兼容性、LLM推理性能到实际使用体验,全面对比两款显卡在本地AI场景中的优劣与适用人群。

开发者发现llama.cpp中一个潜藏多年的CUDA精度Bug,仅影响NVIDIA Tesla P100(sm_60架构)。三行代码修复后,KL散度中位数降低约2300倍,首选token一致性从96.5%提升至99.9%,且性能不损反增。本文深入解析Bug根源、测量数据与市场影响。