Arduino Uno Q + Claude:打造自动记录教程的智能工作台

用Arduino Uno Q搭配Claude,创客制作过程自动录制转录并生成图文教程,90分钟成本不足40美分。
B站创作者Kevin McAleer用Arduino Uno Q的MPU+MCU双芯架构,打造了一套"旁观式"智能工作台记录系统。MCU负责低功耗传感(电流钳检测烙铁通电、按钮触发),只有检测到活动时才唤醒MPU端的摄像头和麦克风,避免AI持续运行浪费资源。MPU端以10秒/30秒两个循环分别采集延时照片和分析帧,后者先经OpenCV帧差法过滤静止画面(变化低于4%直接跳过),再将有效帧发送给Claude Sonnet做结构化识别,最终由Opus一次性生成完整教程初稿。转录任务卸载给Mac上约60行Python的Faster Whisper服务,完成全程音频文字化。整套系统搭建仅需数小时,一场90分钟制作的API费用不到40美分,体现了"本地粗筛+云端精算"的边缘AI实用哲学。
创客们做教程时最头疼的往往不是搭建本身,而是事后回忆每一步、整理照片、编写图文说明的繁琐工作。B站创作者 Kevin McAleer 用 Arduino Uno Q 搭配 Claude 系列模型,做了一个能在旁边"默默观察"的智能工作台——它会自动录制、转录、截图、识别组件,并在收工时一键生成一篇可发布的图文教程初稿。整套系统搭建仅用了两三个小时,一场 90 分钟制作的 API 成本不到 40 美分。
一块板子,两台计算机的分工哲学
这个方案的核心是 Arduino Uno Q 的独特架构。它本质上是一台搭载高通芯片、配备 4GB 内存(2GB 版本同样可运行)的完整 Linux 计算机,同时板载了一颗 STM32 微控制器。也就是说,一块板子上集成了 MPU(微处理器)和 MCU(微控制器)两台计算机,这种分工对这个应用场景堪称完美。
为什么需要两台计算机协同?作者点出了关键:如果让视觉模型不间断运行来检测活动,会白白消耗大量算力和电量。而大多数时候,创客其实是坐在工作台前看数据手册、泡茶,或者喝一口无糖百事——并没有值得记录的事情发生。
因此 MCU 端专门负责低功耗的底层传感。它可以接一个 SCT013 非侵入式电流钳,架在烙铁电源线上检测是否通电,从而判断烙铁何时开启;也可以接一个瞬时按钮,短按标记重要时刻,长按两秒以上则结束会话。只有当 MCU 检测到活动时,才会向 Linux 主控端发送信号,唤醒摄像头和麦克风——这种"高开销操作才介入"的设计,是整个系统省电又省钱的基础。

MPU(Microprocessor Unit,微处理器)与 MCU(Microcontroller Unit,微控制器)的核心区别在于设计目标的取舍。MPU 追求通用计算能力,配备完整的操作系统支持、大容量内存接口和丰富的外设,适合运行 Linux、处理图像、跑 Web 服务器等"重"任务,但空闲时功耗较高。MCU 则将处理器、内存、Flash 存储和外设全部集成在一颗芯片上,牺牲性能换取极低的功耗和实时响应能力,启动时间以毫秒计,非常适合持续轮询传感器、驱动 LED、监听按钮这类"守夜"工作。传统嵌入式开发中,这两类芯片通常分别焊在不同的 PCB 上,通过 UART、SPI 或 I2C 总线通信。Arduino Uno Q 把两者集成在同一块板子上,配合标准化的 Arduino 接口,使得这种协同模式对创客来说变得触手可及,无需额外设计主板间的通信电路。
双循环采集与本地变动检测:把成本压到最低
MPU 端运行着一个基于浏览器的 Web 控制面板,实时显示摄像头画面、滚动转录文本、状态指示灯和计时器。系统实际上跑着两个不同速率的采集循环。
延时采集每 10 秒抓取一帧保存到磁盘,全程本地化、不涉及 AI,事后可以拼成完整的延时摄影记录整个制作过程。另一个独立的分析循环每 30 秒运行一次,抓取一帧后,先经过本地的画面变动检测器——它用 OpenCV 逐像素对比当前帧与上一帧,如果变化小于 4%,就直接跳过,不做任何 API 调用。
这个变动过滤网是成本控制的精髓所在。作者算了一笔账:一场 90 分钟的制作,最终只有四五十帧被真正送去分析,而不是几百帧,因为所有静止无动静的画面都被提前滤掉了。
模型选择上也做了权衡:常规的逐帧分析发送给相对便宜、速度更快的 Sonnet 模型,让它返回结构化信息——可见组件、是否发生值得注意的事件、当前是否处于制作阶段,并记录时间戳与关键帧路径。而高成本的 Opus 模型只在最后触发一次,用来对整场制作进行综合判定和总结。

低成本例行分析贯穿整个 90 分钟,高成本全局推理只发生一次,总成本不到 40 美分就能自动生成一份可发布的教程初稿。对创客来说,这个投入产出比相当划算。
OpenCV 的帧差法(Frame Differencing)是计算机视觉中最轻量的运动检测手段之一。其原理是将连续两帧转换为灰度图后逐像素做差值,再统计绝对差超过某个亮度阈值的像素占比,即可量化两帧之间的"变化程度"。这一计算完全在本地 CPU 上完成,不需要 GPU 加速,延迟极低(通常在几十毫秒内)。相比基于深度学习的运动检测模型,帧差法的优势是几乎零成本、对硬件无要求;缺点则是对光线变化(如云层遮住阳光)会产生误报,且无法区分"有意义的运动"与"无意义的背景抖动"——但在本方案中,这个粗筛任务只需要判断"有没有动",并不需要理解"动的是什么",因此帧差法已完全胜任,更精细的语义判断留给后续的 Claude 模型处理。
三台设备各司其职的架构
整个系统由三台设备协作完成。Arduino Uno Q(作者称之为 MonoQ)负责采集数据和展示仪表盘;一台 Mac 笔记本处理繁重的音频运算;云端的 Claude 负责图像理解和最终分类;而板载的 STM32 则在底层默默监控硬件、驱动 LED 屏。
语音转录之所以放在 Mac 上,是因为 Arduino 无法同时处理所有高频任务,而转录对算力要求较高。Mac 端的转录服务器只有约 60 行 Python 代码,是一个加载了英文 Faster Whisper 模型的 Flask 应用。它暴露一个接口,MonoQ 通过 USB 麦克风录制 10 秒音频,把原始音频 POST 给 Mac,Mac 转录后返回 JSON,整个往返只需一两秒。

作者也坦言了 Faster Whisper 的一个古怪之处:由于它在大量 YouTube 视频上训练过,如果环境完全安静、只有背景声,转录文本就会开始冒出奇怪的"幻觉"内容,因此 Web UI 里加了一个降噪门来过滤背景杂音。
Faster Whisper 是 OpenAI Whisper 语音识别模型的高效推理实现,由 SYSTRAN 基于 CTranslate2 推理引擎重新实现。相比原版 Whisper,Faster Whisper 在 CPU 上的推理速度可提升 4 倍以上,在 GPU 上则更为显著,同时内存占用大幅降低。它支持多种模型规格(从 tiny 到 large-v3),可以在没有独立显卡的普通笔记本上流畅运行英语转录任务。Flask 则是 Python 生态中最轻量的 Web 框架之一,用约 10 行代码即可将一个函数暴露为 HTTP 接口。两者组合成"60 行本地转录服务器"是一种在创客圈颇为流行的模式:把算力密集型任务封装成微服务,让资源受限的主控设备通过 HTTP 调用,既保留了灵活性,又避免了在嵌入式端移植复杂依赖的麻烦。
LED 状态灯与实际使用体验
连接到 MCU 的 8x13 红色 LED 点阵有五种显示状态,直观提示系统当前工作情况:空闲时像心跳一样缓慢呼吸闪烁;录制时两个点来回扫描如同眼睛注视;检测到重要事件时整个点阵高亮;思考分类时出现对焦线扫描图案;任务全部完成则显示一个勾选标记。
实际操作中,当作者不与它交互时,系统不会拍摄任何画面。点击"开始会话"后,仪表盘的转录区域滚动显示自言自语的内容,时间计数器递增,摄像头实时捕捉画面。它能识别桌上的开发板、检测到移动物品和插接组件的动作。想展示某个细节时,按下"立即快照"按钮即可专门拍下那一帧。

收工时点击"停止会话",LED 闪烁紫光并显示 V 字形思考图案,表示正把整个会话发送给 Opus 生成总结。下载生成的博客文章后,里面包含了拍摄的照片、逐步说明和一份详尽的物料清单。
作者也如实指出了系统的局限:转录效果"不算特别好",而 Sonnet 因为知识库稍显陈旧,多次把 Arduino 板子误认成 Micro:bit。但整体而言,这些生成的文本可以直接导入他常用的剧本工具生成 YouTube 分镜脚本,大大减轻了后期整理负担。
硬件清单与启示
复现这套系统所需硬件并不昂贵:一块 Arduino Uno Q、一个约 15 英镑的普通 1080P USB 摄像头、一个 SCT013 电流钳(接模拟口 A0)、一个瞬时微动按钮(接数字口 2)、板载的 LED 点阵屏,加上一台运行转录服务的 Mac 或树莓派即可。
这个项目最值得借鉴的,不是它能生成多完美的教程,而是它展示了一种务实的"边缘 AI"设计思路:用廉价的本地传感和图像差分做粗筛,把昂贵的云端大模型调用压缩到最少,让"智能"只在真正需要时才启动。这种分层过滤、成本敏感的架构,对任何想把 AI 落地到实际硬件项目的开发者都有参考价值。项目完整代码和说明可在作者的 kevsrobots.com 网站获取。
相关推荐

Cloudflare开源决策模型Clef,亚马逊80亿芯片剥离出表
Cloudflare开源决策模型Clef刷新43项基准,亚马逊将80亿美元英伟达芯片剥离出表转向轻资产,华尔街启动600亿美元AI芯片融资,人形机器人半年出货暴增432%,一文速览今日AI行业要闻。

CSS开发者偏好实录:Adam Argyle谈最爱的颜色、单位与属性
CSS专家Adam Argyle在前端快问快答中分享最爱的颜色、格式、属性和单位,对比社区投票揭示OKLCH普及、display与rem称王、grid渐变常需查文档等前端生态信号。

DeepSeek Harness全模态桌面端搭建指南:生图、视频、远程操控全打通
手把手教你把 DeepSeek Harness 打造成全模态桌面端:用 DSH Desktop 安装客户端,接入 Agnes 免费生图生视频、DeepSeek V4.1 Flash 视觉理解、AnySearch 联网搜索,并通过 Anywhere 实现手机远程操控电脑。