共 20 篇相关文章

APAC Egocentric Stereo数据集覆盖车库、工厂、工地等真实工作场景,提供立体视觉、深度渲染、手部追踪等多模态标注,填补机器人训练数据在工业场景中的空白,支持FiftyOne格式浏览。

Microduck是Pollen Robotics开源的双足机器人项目,凭借高质量执行器建模实现了出色的sim2real迁移效果。本文解析其技术原理、开源价值及未来自主行为探索方向。

探讨农业采摘机器人如何通过重新设计末端执行器,解决蘑菇密集种植环境中的狭窄空间抓取难题。从侧向抄取菌柄的创新方案,到视觉盲区与柔性抓取的工程权衡,解析农业机器人从实验室验证到实战落地的迭代路径。

探索一位独立开发者如何用3D打印、ROS 2和自制动画编辑器,将皮克斯经典小台灯变成真实的机器人角色。从硬件外壳设计到动画编排,再到强化学习驱动的自主行为,完整解析这个融合机械、视觉与AI的开源机器人项目。

XLeRobot是一款开源DIY家用机器人,使用3D打印零件、廉价舵机和深度相机,通过本地微调SmolVLA视觉语言动作模型,实现从环境探索、物体定位到机械臂操控的端到端自主任务闭环。

Mighty SLAM相机板仅凭一颗全局快门相机加IMU,在设备端实时完成视觉惯性里程计(VIO)、深度估计与三维障碍物建图,为机器人和无人机提供低成本自主导航方案。

深入解析Mighty Camera Board如何仅用一颗全局快门相机和IMU,在设备端实时完成VIO视觉惯性里程计、深度估计与障碍物三维建图,为机器人和无人机提供碰撞避免与自主导航能力。

一位网友在旧货店以6美元淘到波士顿动力Spot机器人校准靶。本文解析校准靶在机器人视觉系统中的作用,包括传感器标定原理、Spot多传感器融合需求,以及这块靶子的收藏与实用价值。

深度解析一套运行在笔记本上的实时水下图像处理系统,通过CUDA加速与自适应Sea-Thru引擎实现4K 60FPS水下视频实时色彩还原,集成HUD遥测,搭载FIFISH V-EVO水下机器人完成真实海域测试。

DIY机械臂台灯Watti实测重复定位精度达0.03mm,接近工业机械臂水准。本文解析重复定位精度的含义、测试方法及其在3D扫描等应用中的价值,探讨桌面级机器人DIY趋势。

为计算机视觉与机器人交叉领域的博士申请者提供完整指南,涵盖低GPA应对策略、研究方向选择、学习路径规划、优先级排序等核心问题,帮助初学者系统规划科研之路。

Waymo CEO公开阐述特斯拉纯视觉自动驾驶方案的核心局限,从摄像头物理边界、冗余安全缺失、成本与安全权衡等角度解析多传感器融合方案的优势,深度剖析自动驾驶两大技术路线之争。

深入解析RGB可见光相机与热成像相机图像配准的两种主流方案:基于特征匹配的单应性变换和立体标定图像校正。涵盖跨模态配准原理、热成像标定技巧、深度缺失问题及工程实践建议。

探讨从单张法线图重建三维网格的核心难题——深度不连续处理。介绍逐像素权重方法如何让表面自然断开,避免强行积分导致的几何错误,并分析细小结构可靠性与绝对尺度标定两大未解问题。

Maptoolkit.org 是基于 OpenStreetMap 和 MapLibre 的免费矢量瓦片服务器,支持3D地形、山体阴影、户外样式,无需注册、无API密钥、无请求限制,适合开源项目和独立开发者使用。

深入解析基于单个RGB摄像头的实时3D人体网格重建项目,采用Rust、Candle与CUDA技术栈,在RTX 5080上实现55毫秒/帧的处理速度。探讨其技术原理、跨平台Metal移植计划及在VTuber、AR/VR、运动分析等领域的应用前景。

深入分析MVTec Merlic在机器人抓取定位(Pick and Place)中的实际能力与边界,对比Halcon在手眼标定、3D位姿估计方面的优势,提供工业机器视觉软件选型的务实建议。

Ego Vision是一个开源自动驾驶感知项目,整合YOLO11目标检测、ByteTrack多目标跟踪与Depth Anything V2深度估计,实现GO/减速/停车/紧急制动四种驾驶动作预测。本文深度解析其技术架构、决策逻辑与工程价值。