XLeRobot:开源DIY家用机器人实现端到端自主任务

XLeRobot:一个DIY家用机器人的诞生
近日,一位开发者在Reddit上分享了他的机器人项目——一款名为XLeRobot的小型自主家用机器人。经过长时间的开发迭代,这台机器人终于达到了能够端到端自主完成完整任务的水平:它可以探索并导航房间、定位目标物体、靠近并用机械臂对其进行操控。

与许多依赖昂贵工业硬件的机器人不同,XLeRobot从头到尾都由开发者亲手打造:自行3D打印零件、采购廉价舵机、手工完成布线组装。整个系统在成本控制上下足了功夫,同时又实现了相当完整的自主任务闭环。
硬件架构:低成本的巧妙组合
从公开信息来看,XLeRobot的硬件方案体现了当下开源机器人社区"够用就好"的务实理念。
感知与定位
机器人搭载了Orbbec Gemini 2深度相机,用于获取RGBD(彩色+深度)图像数据。RGBD相机在传统RGB彩色图像基础上,增加了每个像素对应的深度信息(Depth),从而能够重建三维点云。Orbbec Gemini 2采用结构光或主动立体视觉方案进行深度测量,典型精度在毫米级别,有效测距范围覆盖0.2米至数米。这些数据使机器人能够感知障碍物距离、估计物体三维位姿,是室内导航和物体抓取的关键信息源。相比激光雷达(LiDAR),深度相机成本更低且同时提供纹理信息,缺点是受光照影响较大且室外表现有限。这类消费级深度相机近年来价格大幅下降,却能提供足够精度的三维环境感知能力,成为DIY机器人项目的热门选择。
在移动定位方面,机器人采用**轮式里程计(wheel odometry)**来估算自身在空间中的位置。轮式里程计通过测量轮子转动的圈数和角度来推算机器人的位移和朝向变化,其实现通常依赖安装在驱动电机轴上的编码器(encoder),对转速进行积分得到行进距离。这种方法实现简单、实时性好,但存在不可避免的累积漂移问题:轮子打滑、地面不平整、轮径磨损等因素都会引入误差,且这些误差会随时间不断累积。在实际应用中,通常需要与视觉SLAM、IMU惯性导航等手段融合来修正漂移。XLeRobot选择结合深度相机的视觉信息来辅助定位,足以支撑室内环境下的导航需求。
执行机构:廉价舵机驱动的机械臂
机器人配备了一条机械臂用于物体操控,驱动部件使用的是廉价舵机。这种取舍在DIY机器人项目中极为常见——牺牲部分精度和负载能力,换取整体成本的可控性,让个人开发者也能负担得起完整的机械臂方案。
软件核心:本地微调SmolVLA视觉语言动作模型
这个项目最值得关注的技术亮点,在于其"大脑"部分的实现方式。
SmolVLA本地微调
开发者在本地GPU上对SmolVLA进行了微调。SmolVLA是一类轻量级的视觉-语言-动作(Vision-Language-Action,VLA)模型,能够将视觉输入与语言指令映射为机器人的具体动作。VLA模型是具身智能领域近两年最重要的技术范式之一,其核心思想是将大型多模态模型的能力引入机器人控制:模型接收视觉观测(通常是RGB图像)和自然语言指令作为输入,直接输出机器人的低级动作控制信号(如关节角度、末端执行器位移等)。代表性工作包括Google DeepMind的RT-2、斯坦福的OpenVLA等。SmolVLA属于HuggingFace推出的轻量级VLA方案,通过模型蒸馏和架构精简,将参数量控制在可在消费级GPU上运行和微调的范围内,同时尽量保留多模态理解和动作生成能力。
值得强调的是,整个微调过程运行在一块RTX 4060 Ti 16GB显卡上。这是一款消费级中端显卡,售价亲民。RTX 4060 Ti 16GB搭载AD106核心,提供约22 TFLOPS的FP32算力和约176 TFLOPS的FP16张量核心算力。16GB显存在当前大模型时代虽非充裕,但对于参数量在数亿级别的轻量VLA模型,配合梯度累积(gradient accumulation)、混合精度训练(mixed precision)、LoRA等参数高效微调技术,足以完成在小规模示教数据集上的微调。这与两三年前动辄需要多块A100(80GB显存)才能训练机器人基础模型的状况形成鲜明对比,反映了模型压缩和高效训练技术的快速进步,大大降低了参与门槛。
用Meta Quest 3采集训练数据
训练数据的采集同样别出心裁——开发者使用Meta Quest 3 VR头显来收集示教数据集。模仿学习(Imitation Learning)的核心瓶颈之一是高质量示教数据的获取。传统的动作捕捉或运动学示教(kinesthetic teaching)设备昂贵且操作繁琐。VR遥操作利用消费级头显的手柄6DoF追踪能力,让人类操作者在虚拟或增强现实环境中直觉性地控制机器人执行任务,同时记录观测-动作对。Meta Quest 3具备内外追踪(inside-out tracking)和手部追踪功能,追踪精度可达亚毫米级,配合手柄的按键可以方便地标注抓取开合等离散事件。通过VR设备进行遥操作(teleoperation),开发者可以直观地"手把手"演示任务动作,机器人则记录下这些操作轨迹作为模仿学习的训练样本。这种方法大幅降低了数据采集门槛,使个人开发者也能在家中快速积累数百条演示轨迹用于模型训练。
这种"VR遥操作采集数据+本地微调VLA模型"的技术路线,正是近年来机器人学习领域快速普及的范式,此前多见于学术实验室和头部公司,如今已被个人开发者成功复现。
端到端自主:从探索到操控的完整闭环
这台机器人真正的价值,在于它实现了任务的端到端自主执行。传统机器人系统通常采用模块化流水线架构:感知模块负责目标检测与分割、建图模块构建环境地图、规划模块生成路径、控制模块执行动作,各模块之间通过预定义接口通信。这种架构可解释性强但工程复杂,且模块间的误差会逐层传递放大。端到端方案则尝试用神经网络直接从原始传感器输入映射到动作输出,减少人工设计的中间表征。XLeRobot的方案实际上是混合式的:导航阶段仍依赖里程计和空间推理,而物体操控阶段则通过VLA模型实现端到端映射,兼顾了可靠性与灵活性。
整个流程可以拆解为几个环环相扣的阶段:
- 环境探索与导航:机器人自主在房间内移动,构建对空间的认知;
- 物体定位:通过深度相机识别并定位目标物体在空间中的位置;
- 靠近目标:规划路径并移动到物体附近;
- 机械臂操控:使用机械臂完成对物体的抓取或操作。
这四个阶段串联起来,构成了一个完整的自主任务链条。对于一个个人DIY项目而言,能够跑通这样的全流程闭环,本身就是相当可观的工程成就。
开源意义与具身智能的行业启示
开发者表示该项目完全开源,并承诺公开相关链接。这一点对于机器人社区尤为重要。
随着SmolVLA等轻量级VLA模型的出现、消费级深度相机和VR设备价格的下降,以及3D打印技术的普及,具身智能的门槛正在快速降低。曾经只有大型机构才能开展的机器人研究,如今一个开发者用中端显卡、廉价舵机和自己打印的零件就能实现基本的自主操作能力。
这类开源机器人项目的意义不仅在于技术本身,更在于它们汇聚成的社区力量。每一个可复现、可改进的开源方案,都在为整个具身智能生态积累实践经验,加速这一领域从实验室走向大众的进程。
当然,也应保持客观:受限于轮式里程计的精度、廉价舵机的重复性以及轻量模型的泛化能力,这类DIY机器人在复杂多变的真实家庭环境中仍面临诸多挑战。但作为个人探索具身智能的起点,XLeRobot无疑是一个极具启发性的范例。
核心要点
相关推荐

Claude自主设计蛋白质成功率35%,远超人类专家水平
Anthropic的Claude模型在自主设计靶向疾病蛋白质任务中取得35%实验成功率,远超人类专家10%-15%的平均水平。本文深入解析这一湿实验验证成果对生物医药行业的潜在影响。

Perplexity Discover多语言支持突然消失,国际用户为何不满?
Perplexity Discover新闻资讯功能突然取消多语言支持,仅保留英文内容,引发国际用户强烈不满。本文分析功能回退的可能原因,探讨AI产品国际化面临的资源权衡与用户信任挑战。
