ESP32-S3打造桌面机器人Pamk:自定义唤醒词+Gemini替代便利贴

法国学生用ESP32-S3打造桌面语音机器人Pamk,自训唤醒词模型+Gemini理解,替代便利贴管理任务与日程。
一位法国学生为解决备考期间便利贴散乱、提醒失效的问题,独立设计并制作了桌面机器人Pamk。它基于ESP32-S3构建,通过自录数千条音频训练出专属唤醒词「Hey Pamk」,实现无App的本地语音唤醒;唤醒后接入Google Gemini完成自然语言理解,将口语指令解析为结构化任务与日程;语音回应则由作者亲自录制的音频片段拼接,赋予机器人独特人格。硬件上采用INMP441麦克风与MAX98357功放的I2S组合,外壳完全3D打印,脸部面板支持磁吸更换。番茄钟模式以环形进度条围绕机器人面孔呈现,将抽象倒计时转化为可感知的视觉动画。作者计划在积累MakerWorld受众后开放众筹与制作资料,V2版本正在设计定制PCB。
当便利贴被一个会说话的桌面机器人取代
备考期间散落满桌的便利贴,常常提醒了也记不住,记下了又找不到。一位法国学生用一个巴掌大的桌面机器人解决了这个困扰——它叫 Pamk,基于 ESP32-S3 构建,能听懂语音指令、管理任务与日程,并在恰当的时间主动提醒。整个项目从外壳到电路,几乎全部由作者自己完成。
与市面上依赖手机 App 的智能助手不同,Pamk 的交互逻辑非常直接:对它说一声「Hey Pamk」,就能唤醒并开始对话。无需打开任何应用,这种「说完就走」的体验恰恰是桌面效率工具最需要的轻量感。

核心功能:语音驱动的任务管家
Pamk 的定位是一个专注于个人组织效率的桌面伴侣,主要能力包括:
- 纯语音交互:通过自定义唤醒词「Hey Pamk」激活,全程无需 App 介入;
- 任务与日程管理:口述即可添加待办事项和事件,并在设定时间点触发提醒;
- 番茄钟与计时器:内置 Pomodoro 工作法模式,屏幕上的「脸」周围会显示一圈进度环,直观反映剩余时间;
- 可更换面板:3D 打印的脸部面板通过磁吸固定,可以随时替换造型。
进度环这个设计细节值得一提——它把抽象的倒计时转化为围绕机器人面孔的视觉动画,让专注时间变得可感知,比单纯的数字计时更符合桌面陪伴的情感定位。
番茄钟(Pomodoro Technique)由弗朗切斯科·西里洛在 1980 年代末提出,核心规则是将工作切分为 25 分钟的专注块(一个「番茄」),每块之后休息 5 分钟,每完成四个番茄后休息更长时间。这一方法的心理学依据在于:固定的时间盒可以降低任务启动阻力,同时强制的休息有助于维持认知资源。将番茄钟集成到实体桌面设备而非手机 App 中,有助于减少因拿起手机查看进度而引发的分心——这正是 Pamk 环形进度条设计在交互层面的实际价值:让「还有多久」这个问题不需要任何主动操作就能被感知到。
硬件与软件:一次完整的嵌入式实践
Pamk 的技术栈体现了典型的 ESP32 创客项目特征,但完成度相当高:
主控与显示
核心是乐鑫的 ESP32-S3 芯片,这款带 AI 加速指令和充足内存的 MCU,近年来成为语音类 DIY 项目的热门选择。显示部分采用一块 280x240 分辨率屏幕,用来呈现机器人的「表情」。
ESP32-S3 相较于早期的 ESP32 和 ESP32-S2,最显著的升级是内置了向量指令扩展(用于加速神经网络推理)以及更大的片上 SRAM(最高 512KB),并原生支持 USB OTG。对于语音类项目而言,更充足的内存意味着可以在本地运行轻量级的唤醒词检测模型,而无需将所有音频数据传至云端处理。乐鑫官方也围绕 ESP32-S3 推出了 ESP-SR 语音识别框架,包含唤醒词引擎 ESP-WakeNet 和命令词识别引擎 ESP-MultiNet,这正是此类 DIY 语音助手项目的常见软件起点。Pamk 的作者选择自行训练唤醒词模型而非直接使用现成框架,意味着他在定制化和灵活性上付出了更高的工程代价。
音频链路
声音输入由 INMP441 I2S 数字麦克风负责,输出则通过 MAX98357 I2S 功放驱动扬声器。这套 I2S 麦克风加功放的组合是嵌入式语音项目的经典搭配,兼顾了音质与成本。
语音理解与合成
在「听懂」这一环,作者接入了 Google Gemini 来做自然语言理解,把用户的口语指令解析成结构化的任务和日程。而机器人回应的声音,则是作者亲自录制的语音片段拼接而成——这种做法虽然不如 TTS 灵活,却赋予了 Pamk 独特的人格化质感。
特别值得关注的是唤醒词部分:作者没有使用现成方案,而是用自己录制的数千条音频训练了专属唤醒词模型。这是整个项目中技术门槛最高的一环,也解释了为什么 Pamk 能做到无 App 的本地唤醒体验。
唤醒词训练本质上是一个关键词检测(Keyword Spotting, KWS)的二分类问题:模型需要从连续音频流中实时判断目标词是否出现,同时对误触发(False Positive)和漏触发(False Negative)保持极低容忍。训练数据需要覆盖不同距离、不同噪声环境、不同说话人的发音变体,这也是为何作者需要录制数千条样本。常见的轻量级 KWS 模型架构包括 DS-CNN(深度可分离卷积网络)和基于 LSTM 的变体,推理时通常在 MFCC(梅尔频率倒谱系数)特征上运行,整个模型可以被压缩到数十 KB 以内,适合在 MCU 上本地部署。自训练模型的优势在于唤醒词完全私有化,且推理完全离线,不依赖任何云端服务,这与后续 Gemini 联网理解形成了有趣的「本地唤醒 + 云端理解」分层架构。
结构设计
外壳完全由 3D 打印完成,磁吸式可换面板的设计既方便又增加了可玩性。作者还透露 V2 版本正在设计定制 PCB,意味着这个项目正从原型走向更成熟的产品形态。
从个人项目到开源计划
作者在 MakerWorld 上分享自己的 3D 模型作品(目前是一些万圣节小摆件),并计划在积累足够关注度后开放 Pamk 的众筹与制作资料。按照他的说法,MakerWorld 只向有一定受众基础的创作者开放众筹,因此他希望先建立社区,再让更多人能够自己动手复刻这台机器人。
这种「先开源传播、再逐步产品化」的路径,是当下独立硬件创作者常见的成长方式。对于想入门语音交互嵌入式项目的开发者来说,Pamk 提供了一个相当完整的参考样本:从麦克风采集、唤醒词训练、云端 LLM 理解到个性化语音输出,几乎覆盖了一个端到端语音助手的全部关键模块。
一点观察
Pamk 最打动人的地方,并不是堆砌了多先进的硬件,而是它把「替代便利贴」这个朴素需求打磨到了可用的程度。自定义唤醒词、自录语音、磁吸换脸这些细节,都指向同一个方向——让一台 DIY 机器人真正融入日常使用,而不是停留在演示阶段。
当然,接入 Gemini 意味着语音理解需要联网,隐私与离线可用性是这类项目后续需要权衡的点。但作为一个学生的个人作品,Pamk 在工程完整度和产品思维上的表现,已经远超许多同类创客项目。期待它开源后能看到更多社区变体。
项目演示视频(法语,含英文字幕):https://youtu.be/_wxieeF5Wrw
相关推荐

LangChain的商业模式还能走多远?LangSmith面临的生存挑战
LangChain的核心营收依赖LangSmith,但AWS Omni等云厂商原生可观测性工具的崛起正在挤压其增长空间。本文分析独立AI开发工具与云原生方案的护城河之争,以及LangChain面临的商业化挑战。

用强化学习在UE5中训练AI钢铁侠:PPO算法救援13名乘客实验
一位开发者在虚幻引擎5中用PPO强化学习算法训练AI钢铁侠,让其学会飞行救援13名下坠乘客。本文解析该体素风格项目的技术思路、PPO选型逻辑与UE5仿真训练的价值与局限。

传奇设计师Richard Garriott重掌《创世纪》系列版权
游戏传奇设计师Richard Garriott正式重新获得经典RPG系列《创世纪》(Ultima)的控制权。本文解读这一版权回归对玩家与游戏行业的潜在意义。