Claude Code 本地化运行:Apple Silicon 上的全离线 AI 编程方案

开源项目 claude-code-local 让 Claude Code 完全跑在 Apple Silicon 本地,专为隐私合规场景提供离线 AI 编程能力。
claude-code-local 是一个基于苹果 MLX 框架构建的开源项目,通过在本地模拟 Anthropic API 接口,让原本依赖云端的 Claude Code 编程助手转而调用本地大模型推理,实现 100% 离线运行。项目支持 Qwen 3.5 122B、Llama 3.3 70B、Gemma 4 31B 等主流开源模型,其中 122B 模型在合适的 Apple Silicon 设备上可达约 65 tokens/秒的生成速度。其核心价值在于"airgap-ready"的设计定位——专为 NDA、法律、医疗等无法将代码或数据上传云端的合规场景而生,填补了传统云端 AI 编程工具在高度敏感环境中的空白。随着开源模型能力持续提升,该项目代表了本地大模型从演示走向实际生产力工具的趋势,但运行大参数模型对 Mac 内存配置的要求较高,普通设备用户需结合实际硬件选择合适的模型规格。
Claude Code 本地化运行:Apple Silicon 上的全离线 AI 编程方案
AI 编程助手正在改变开发者的工作方式,但对许多身处敏感行业的团队来说,一个绕不开的障碍是:代码不能上传到云端。开源项目 claude-code-local 给出了一种直接的解法——让 Claude Code 完全跑在本地设备上,100% 离线运行,专为 NDA、法律与医疗等对数据保密性要求极高的场景而设计。
该项目目前已在 GitHub 收获约 2509 个 Star 和 491 次 Fork,使用 Python 开发,社区关注度不低。

核心思路:MLX 原生的 Anthropic API 服务器
这个项目的关键在于它构建了一个 MLX 原生的 Anthropic-API 兼容服务器。简单来说,它在本地模拟了 Anthropic 官方 API 的接口规范,让原本需要连接云端的 Claude Code 客户端,转而向本地运行的模型发送请求。
MLX 是苹果为自家芯片打造的机器学习框架,针对 Apple Silicon(M 系列芯片)的统一内存架构做了深度优化。选择 MLX 而非通用推理方案,意味着项目能够更充分地压榨苹果芯片的性能,让大模型推理在 Mac 上跑得更快、更省内存。这也是它能在消费级设备上运行数十亿至百亿参数模型的技术前提。
对于开发者而言,这种"接口兼容"的设计有个明显好处:无需改动现有的 Claude Code 使用习惯,只是把后端从云端换成了本地,迁移成本极低。
MLX 框架于 2023 年底由苹果机器学习研究团队开源发布,其最大的设计亮点是「统一内存架构」的充分利用——在 Apple Silicon 上,CPU 与 GPU 共享同一块物理内存,无需像传统 PC 那样在主内存和显存之间频繁拷贝数据。这使得 MLX 在推理大型语言模型时,能够把整个 Mac 的全部内存(例如 M4 Max 的 128GB)都当作「显存」来使用,这是 Nvidia GPU 方案在消费级设备上难以复制的优势。相比同类本地推理框架 llama.cpp 或 Ollama,MLX 使用 Python 优先的 API 并针对 Metal(苹果 GPU 计算接口)做了底层优化,在 M 系列芯片上通常能取得更高的 tokens/秒吞吐量。这也解释了为何 claude-code-local 选择以 MLX 为核心而非更通用的推理后端。
支持的本地模型与性能表现
项目宣称支持多款主流开源大模型,并给出了具体的推理速度参考:
- Qwen 3.5 122B:约 65 tokens/秒
- Llama 3.3 70B
- Gemma 4 31B

其中 65 tok/s 的生成速度对于一个 122B(1220 亿参数)级别的模型来说相当可观,说明在合适配置的 Apple Silicon 设备上,本地运行大模型已经具备了实用价值,而非停留在"能跑"的演示阶段。多档位模型的选择也让用户可以根据自己的硬件条件在速度与能力之间做权衡——较小的 Gemma 4 31B 适合内存有限的机器,而 Qwen 3.5 122B 则面向追求更强代码能力的重度用户。
需要提醒的是,这些性能数字来自项目自述,实际表现会随硬件规格(尤其是内存容量)和任务类型出现波动,读者应以自身环境的实测结果为准。
理解这些参数量级对硬件需求的影响有助于评估可行性。大型语言模型通常以 16 位浮点(FP16)或 4 位量化(Q4)格式存储权重。以 122B 参数模型为例,FP16 格式需要约 244GB 内存,而采用 4 位量化后可压缩至约 61-80GB,仍需要 Mac Studio Ultra 或配置 128GB 统一内存的顶配 MacBook Pro M4 Max 才能完整载入。Llama 3.3 70B 量化后约需 35-45GB,Gemma 4 31B 则约需 16-20GB,后者在配备 24GB 或 32GB 内存的 MacBook Pro 上即可运行。因此,模型选择实际上受制于硬件配置,65 tok/s 的 122B 推理速度需要以高端 Apple Silicon 设备为前提。
为谁而生:隐私敏感的专业工作流
项目的定位非常清晰——Private、offline、airgap-ready(私密、离线、可物理隔离)。它把目标用户直接锁定在了 NDA、法律和医疗等工作流上。
这些场景的共同特征是:数据一旦离开本地就可能构成合规风险甚至法律责任。律师事务所处理的案件材料、医疗机构涉及的患者数据、签署了保密协议的商业代码,都无法接受被发送到第三方云服务的可能。传统的云端 AI 编程工具在这些行业面前几乎无从落地。
"airgap-ready"(支持物理隔离网络)是一个尤其值得关注的表述。它意味着这套方案理论上可以部署在完全断网的环境中运行,这正是高度敏感机构(如政府、金融、军工)的典型部署要求。把 AI 编程能力带进这些封闭环境,是云端方案无论如何都做不到的。
"Airgap"(气隙隔离)是网络安全领域的专业术语,指一台计算机或网络与外部互联网及其他网络之间存在物理断开,没有任何有线或无线连接。这是防止数据泄露和外部攻击的最极端手段,常见于核电站控制系统、军事指挥网络、金融清算核心节点和涉密政府机构。由于 airgap 环境中的设备无法访问任何在线服务,传统依赖云端 API 的 AI 工具在这些环境中完全失效。claude-code-local 声称支持 airgap 部署,意味着只要提前将模型权重下载到本地,整个推理过程不需要任何网络请求,可以在物理断网的机器上持续运行,这对于合规要求最为严苛的机构具有独特价值。
意义与局限
claude-code-local 代表了一个正在升温的趋势:本地大模型正从"玩具"走向"生产力工具"。随着开源模型能力逼近闭源产品、苹果芯片推理性能持续提升,把强大的 AI 助手完全握在自己手里,不再是技术极客的专属。
不过也要客观看待它的边界。本地运行意味着用户需要自备足够强的硬件——运行 122B 级模型对内存的需求不容小觑,这可能将不少普通用户挡在门外。此外,本地开源模型在代码理解与生成的综合能力上,是否能完全替代云端的旗舰 Claude 模型,仍需要在实际项目中长期验证。
对于那些因合规原因始终无法使用云端 AI 编程工具的团队来说,这个项目提供了一条此前几乎不存在的路径。它的价值不在于跑得多快,而在于让"离线"和"AI 编程"这两件看似矛盾的事,第一次变得可以兼得。
本文基于该开源项目的 GitHub 页面信息整理,具体功能、性能与部署要求请以项目官方文档为准。
相关推荐

Trail of Bits 如何验证 Signal 聊天记录的完整性
Trail of Bits 作为独立安全审计机构,如何帮助验证 Signal 端到端加密聊天记录的完整性?本文梳理聊天完整性验证的技术背景与第三方审计的价值。

Kimi 2.6 Code:基于Moonshot模型的终端编程智能体
kimi-2-6-code 是一款基于 Moonshot Kimi K2.6 模型、用 TypeScript 编写的终端原生编程智能体。本文解析其技术定位、模型选择逻辑与项目成熟度,帮你判断是否值得尝试。

Kimi K2:月之暗面开源的大模型系列全解读
Kimi K2 是月之暗面 Moonshot AI 团队开发的开源大语言模型系列,GitHub 已获超万颗 Star。本文解读其项目背景、开源价值与上手方式。