AIO服务器搭建指南:双B70显卡打造本地AI管家

用双B70显卡本地部署大模型,打造会看会说会干活的工作室AIO服务器。
本文记录了一台面向工作室的All-in-One服务器的完整搭建思路:以明轩AI Micro Station为底座,搭载两张32GB显存的ARC Pro B70,一卡跑千问3.6 35B大模型做AI管家,一卡跑ComfyUI做创作。通过将MiLocal智能监控方案的模型地址全部指向本地vLLM接口,并将摄像头协议改为通用RTSP,实现了零API费用的本地化感知闭环:摄像头看到异常→大模型理解画面→OpenCode通过飞书推送报警或语音播报。32GB大显存带来的超长KVCache使多客户端并发成为可能,同时支撑MiniMax H3视频生成的FP16原版模型推理。整套方案目前仍处于雏形阶段,人脸识别偶有误判,但展示了算力彻底本地化的真实潜力。
从跑分到智能:AIO服务器的进化方向
距离上一次装机已经过去了不少时间,2026年的今天,AI早已成为一股无法回避的大潮流。那么在这个时间点,一台面向工作室的All-in-One(AIO)服务器,究竟应该能做到什么?
据B站UP主苏欧陀的分析,答案已经不再是简单的堆料。CPU、显卡再强,无非是玩玩云游戏、跑跑转码;八盘位万兆的NAS存储方案,玩家们也早已玩腻。真正代表未来的形态是:会看、会听、会说话,还会自己干活。
这台机器可以在下午6点半提醒你「今天辛苦了该下班了」;发现你上班摸鱼刷手机太久,会喊你「别看手机了快干活」;半夜机房进人时,一边给你推送报警,一边通过飞书把画面发到你手机上。你人在外面问一句「现在什么情况」,它看一眼摄像头就能告诉你。这套体系的核心,是把算力彻底本地化,不花一分钱API费用。



硬件配置:双B70显卡的两颗心脏
这台机器的基础是明轩AI Micro Station工作站准系统,采用上下分舱设计:下舱放处理器、内存和ATX电源,上舱则提供两个多槽PCIE显卡位。两张显卡一个朝前一个朝后抽风,风道互不干扰。如果不装双卡,其中一侧的显卡舱还能通过框架变成4个3.5寸盘位,主板甚至预留了Mini-SAS接口,对偏纯存储的用法很友好。
核心规格清单
- CPU:英特尔Ultra 9 275HX,24核,带4条内存槽
- 内存:拼凑方案凑够96GB(作者坦言在当前内存价格下属于「亡命之徒」玩法)
- 存储:两块4TB M.2打底,预留PCIe 4.0 x4槽位可扩展
- 显卡:两张明轩ARC Pro B70
B70采用BMG G31核心,32组Xe内核,32GB显存,608GB/s显存带宽。这张卡最值钱的地方就是那32GB大显存——这也是整套方案能够多客户端并发而不「打架」的物理基础。
系统与部署:OpenCode一句话搞定
系统底子选择了Ubuntu 24.04,原因很直接:它的内核是7.0,而Battlemage架构的B70需要6.17以上内核才能正确识别。装完系统后两张卡直接到位,在/dev/dri下出现两个节点(Render D128与D129)。
装系统时一定要勾上SSH服务,因为后续几乎所有部署都靠OpenCode远程完成,完全不用手动敲命令。这里有个实战小技巧:本地跑OpenCode通过SSH连服务器,即便服务器重启,你的会话也不会丢;而如果直接在服务器上跑,一重启就会断连。
双卡分工策略
- GPU0(第一张B70):独占运行千问3.6 35B A3B模型,做AI管家的大脑。部署方式是把英特尔专用的vLLM(LMScaler)项目地址丢给OpenCode,它会自动完成配置甚至下载模型。
- GPU1(第二张B70):部署ComfyUI,使用XPU后端,对英特尔显卡支持良好,用于视频、图片、语音创作。
为什么不搞张量并行?单卡32GB显存已经能跑到256K上下文,这已是35B模型的原生上限,没必要拆卡。采用一卡一实例方案,一张聊天一张创作,谁也不抢谁的显存。
性能实测数据
采用INT4动态量化权重、KVCache走FP8,权重占21.9GB显存,KV占8.5GB,利用率拉到0.95。在此配置下单对话最大上下文256K,KVCache总容量850K Token。实测单人最高速度约80 Tokens/秒,并发可达500 Tokens/秒以上,足以支撑多人多应用同时调用。
MiLocal + OpenCode:让服务器长出眼睛和大脑
真正的玩法在于用MiLocal和OpenCode把整台机器串起来。
MiLocal是小米开源的智能家居监控管理方案。它的设计思路是:用一个Omni小模型负责「看」(摄像头画面识别),云端模型负责「想」(判断、规划、工具调用),感知到场景后触发预设报警或联动米家设备。
两处关键魔改实现完全本地化
但官方方案对工作室有两个尴尬问题,作者据此做了魔改:
- 模型本地化:官方两个模型都在云端,7×24小时运行会让API账单持续增长,且不希望工作室发生的每件事都被服务商获取。魔改后把MiLocal和OpenCode的模型地址都指向本地vLLM接口——本地推理走标准API,改起来很简单。云端账单清零,报警也不会外泄。
- 摄像头兼容:官方只认米家自家摄像头。改为通用RTSP协议后,机房任意摄像头都能接入拉流。不过RTSP流暂时无法整合进MiLocal的WebUI,作者单独做了监控页面追踪事件。
协同工作闭环
分工非常清晰:MiLocal负责「看」,画面出来后做增采样和门控,无变化就跳过节省算力,有变化才送到35B模型做结构化理解;OpenCode负责「想和做」,作为Agent调用本地35B,理解任务、拆解步骤、通过MCP工具执行。
举例:摄像头看到陌生人进机房→MiLocal规则命中→OpenCode把报警推到飞书+TTS语音播报,闭环完成。而32GB大显存换来的大KVCache和强并发,正是两个客户端同时调用35B模型不会排队打架的关键。
实战能力:会看会记会管理
感知与查询
手机问一句「工作室现在什么情况」,它汇总事件发过来;问「画面里是谁」,它借助MiLocal的人脸识别功能直接点名(白名单注册过的能认出具体是谁,没注册的就是陌生人)。所有事件都存成快照(视频片段+推理记录),可以查「上午10点机房发生了什么」「昨天摸了几次鱼」,一条不落,且无需提前训练就能分辨画面正在发生的事。
自然语言设规则
只需一句话就能设规则:「工作时间不要玩手机否则报警」「有人搬主机就报警」,不用预训练、不用换模型、不用画逻辑图。几个极端测试场景:
- 烟雾检测:镜头前模拟烟雾,35B当场判断「检测到烟雾疑似火灾」触发最高级报警——没用任何专门的火焰识别模型,纯靠大模型看懂画面。
- 陌生人入侵:深夜未注册者进机房,人脸识别判定非白名单,语音警告+飞书推送快照留证,全程只需几十秒。
- 人性化联动:上班时间白名单成员进门,可自动开空调、语音播报,甚至根据穿着点评一番。
自我管理与NAS功能
服务器还能管好自己:飞书发一句「看看服务器状态」就回一份运行报告;问「vLLM跑在哪个端口」它直接答(部署时已记下);ComfyUI出问题让它重启容器,确认、重启、汇报一条龙。它还兼具NAS身份,一句大白话就能自动配置。
不过需要注意:让OpenCode创建定时巡检任务时,这类AI工具的定时任务对付费Token额度消耗相当恐怖——曾用近200元/月的Coding Plan配了三个定时服务,几天就烧光额度。所以简单巡检任务用免费的本地35B模型反而更划算。
创作能力:MiniMax H3的Zero-Day支持
照顾好自己之余,这台机器的主业是创作。视频生成方面此前已用B70测过LTX 2.3,但这次不同——MiniMax H3刚开源,B70就做了Zero-Day支持,官方工作流直接可用。
出片性能实测
默认工作流、原生分辨率、无超分:
- 480P 5秒:约200秒出片
- 720P:约60秒
- 1080P 5秒:约2300秒
套上加速LoRA还能再快2-3倍。重点是H3能根据Prompt直接做分镜切换,镜头、运镜、场景转换都按写的来,画面动态可用性比LTX 2.3高了一整个级别。工作室已把方案全面换成它,「以前抽卡小心翼翼,现在起手就是两个四个开始生成,内心毫无波澜」。
此外32GB显存能直接跑FP16、FP8原版模型,不用换GGUF量化版——原版才是质量的天花板。语音生成、文生图也都能一站式包圆。
现实评价:潜力初现但仍需打磨
这套方案仍处于非常雏形的阶段:
- 人脸识别:白名单样本少时会认错人,身形相像就可能误判,进而误触发规则。
- 事件感知:画面变化太大或规则未覆盖时,偶尔会漏掉事件,提醒可能遗漏。
即便如此,这台机器展示了算力本地化的真实潜力。三样能力凑齐才是它最舒服的地方:兼容性(H3当天Zero-Day支持、主流模型都能跑)、大显存(32GB高KVCache、超长上下文随便开)、并发(多人同时用vLLM不排队)。它可能只是一个雏形,但一切都从雏形开始。
相关推荐

@ai-sdk/zai@3.0.10 发布:依赖更新的补丁版本解析
Vercel AI SDK 发布 @ai-sdk/zai@3.0.10 补丁版本,同步更新 provider、provider-utils 与 openai-compatible 等底层依赖。本文解析该版本变更内容及 AI SDK provider 体系的设计意义。

Vercel AI SDK 更新:@ai-sdk/workflow 2.0.29 修复工具结果保留问题
Vercel AI SDK 发布 @ai-sdk/workflow 2.0.29 补丁版本,核心修复工作流在终止、延迟、暂停三种响应状态下 provider 工具执行结果的保留问题,并同步升级 ai@7.0.98 等核心依赖。

Vercel AI SDK 更新:@ai-sdk/xai 4.0.58 批处理与图像生成改进
Vercel AI SDK 发布 @ai-sdk/xai 4.0.58 版本更新,新增批处理图像生成支持,修复批处理请求类型校验及 DeepSeek 推理流问题,并同步升级 provider 相关依赖。