自建多模态数据集:从500帧到300万帧的自动化标注实践

当找不到好数据集时,就自己造一个
在计算机视觉领域,数据集的质量往往决定了模型的上限。然而,现成的公开数据集常常无法满足特定场景的需求——尤其是涉及多光谱、多模态融合的实际应用。一位工程师在社交平台分享了他的解决方案:既然找不到合适的数据集,那就亲手打造一个。
这个项目的核心思路极具启发性:通过 RGB(可见光)与 LWIR(长波红外)双模态传感器的协同标注,结合半自动化的数据挖掘流程,逐步构建出一个规模达到约 300 万帧 的自有数据集。这不仅是一次数据工程实践,更展示了个人开发者如何用有限资源实现工业级的数据闭环。
LWIR 技术简介
长波红外(Long-Wave Infrared,LWIR)是指波长在 8-14 微米范围内的电磁辐射。与可见光传感器捕获反射光不同,LWIR 传感器接收的是物体自身发出的热辐射,因此不依赖外部光源,能在完全黑暗、雾霾、强逆光等可见光摄像头失效的场景下正常工作。这一波段之所以被称为"大气窗口",是因为地球大气层对 8-14 微米波段的红外辐射吸收较少,使得热信号能有效传播到传感器。在自动驾驶和安防领域,LWIR 热像仪能清晰检测到行人、车辆等热源目标,目标与环境背景的温度差提供了天然的分割线索。
典型的非制冷 LWIR 探测器(如氧化钒微辐射热计)的热灵敏度(NETD)可达 50mK 以下,意味着能分辨不到 0.05°C 的温差。氧化钒微辐射热计(VOx microbolometer)是目前非制冷红外探测器的主流技术路线,其工作原理基于电阻温度效应:入射红外辐射被吸收层吸收后转化为热能,导致氧化钒薄膜温度升高,进而引起电阻值变化(氧化钒的温度电阻系数 TCR 约为 -2%/K 至 -3%/K),这一电阻变化被读出电路(ROIC)测量并转换为电信号。由于不需要像 InSb 或 HgCdTe 探测器那样进行低温制冷(后者需要斯特林制冷机将探测器冷却至 77K),非制冷型探测器的体积、功耗和成本大幅降低,使其能够集成到车载系统中。
然而,LWIR 图像的空间分辨率通常低于可见光相机(常见分辨率为 640×512,远低于 RGB 相机的百万像素级别),且缺乏颜色和纹理信息——这正是需要 RGB 与 LWIR 进行多模态融合的根本动机。
从零启动:V1 模型的冷启动策略
任何自建数据集都面临一个经典的"鸡生蛋"难题:没有标注数据就无法训练模型,没有模型又难以高效标注海量数据。这一冷启动问题在机器学习领域由来已久,常见的解决思路包括迁移学习、少样本学习和主动学习(Active Learning)。主动学习的核心思想是让模型主动选择最具信息量的样本请求人工标注,而非随机或全量标注——经典策略包括不确定性采样(选择模型最不确定的样本)、查询委员会(多个模型投票不一致的样本)和期望模型变化(标注后对模型参数影响最大的样本)。
在目标检测的语境下,冷启动涉及到标注预算分配的优化问题——如何以最少的人工标注获得最大的模型性能提升。研究表明,对于深度学习模型,初始标注集的选择对最终性能有显著影响:随机选择的 1000 个标注样本,其训练效果可能不如精心挑选的 200 个样本。这就是为什么作者选择 500 帧而非随机的 5000 帧作为起点——关键不在于数量,而在于样本的代表性和多样性。
本文作者的方法实质上是主动学习中"查询委员会"策略的一种跨模态变体——通过双模态检测差异来识别模型最不确定的样本,这些恰好是对模型改进最有价值的困难案例(hard examples)。作者采用了务实的分阶段冷启动方案。
借力 COCO 数据集进行初始标注
第一版模型(V1)基于 COCO 数据集在 RGB 图像上完成预训练。COCO(Common Objects in Context)是微软于 2014 年发布的大规模目标检测与分割数据集,包含 33 万张图像、150 万个目标实例和 80 个物体类别,是计算机视觉领域最广泛使用的预训练基准之一。利用 COCO 预训练模型作为起点,意味着可以继承其在通用物体识别上的特征提取能力,仅需少量领域数据即可完成迁移适配——这正是迁移学习的经典应用。作者选取了 500 帧图像,手动修正标注框,并利用 LWIR 与 RGB **同轴校准(bore sighted)**的特性,将 RGB 上的标注直接映射到红外图像上。
同轴校准是一种源自军事瞄准系统的光学对准技术。在武器系统中,bore sighting 最初指将瞄准镜的光轴与枪管轴线精确对齐。在多传感器融合系统中,这一术语被借用来描述将不同传感器的光轴精确对齐,使它们在同一时刻观察到完全相同的视场(Field of View)。实现这一点通常需要精密机械夹具将传感器固定在同一基座上,并通过标定板(如棋盘格或圆形点阵)进行亚像素级的几何校正。校准过程需要同时考虑内参(焦距、畸变系数)和外参(传感器间的旋转和平移),通常使用 Zhang 标定法或更高精度的全局优化方法。
在实际工程中,完美的同轴校准几乎不可能实现——总会存在残余配准误差。对于目标检测任务,关键问题是这一误差是否影响标注框的可用性。以分辨率 640×512 的 LWIR 图像为例,如果校准残余误差为 2 个像素,对应的角度误差约为探测器像元间距(17 微米)除以镜头焦距。对于一个占据 100×100 像素的目标,2 像素的偏移仅引起约 2% 的 IoU 下降,对训练几乎无影响。但对于远距离小目标(如仅占 10×10 像素),同样的 2 像素偏移可能导致 20% 的 IoU 损失,此时需要更精细的校准或距离自适应补偿。
一旦完成校准,RGB 图像上任意一点的坐标可以通过简单的仿射变换或单应性矩阵(3×3 Homography Matrix)直接映射到 LWIR 图像的对应位置——前提是场景中目标距离远大于传感器基线距离(即可忽略视差)。这种物理级别的对齐消除了复杂的跨模态配准算法需求,使得一次标注即可零成本迁移到另一个模态,大幅降低了初期标注成本。
迭代式人工校正
V1 模型训练完成后投入运行,作者亲自检查了约 1500 次检测调用,手动挖掘误报(false positives)、调整边界框位置,然后重新训练。误报在目标检测中尤其有害——它们不仅降低精确率(Precision),还会在自动驾驶场景中引发不必要的紧急制动或避障操作。通过手动审核,作者实际上是在构建一个高质量的"负样本集"(negative mining),告诉模型哪些看起来像目标但实际不是的模式需要被抑制。这个阶段仍然高度依赖人工,但为后续的自动化奠定了模型基础。正是这批经过反复打磨的种子数据,让整个流程得以"越滚越大"。
半自动化数据挖掘:让双模态模型互相纠错
项目最精妙的设计在于利用双模态之间的检测差异来自动挖掘高价值样本。
作者设计了一个基于"检测持续性"的挖掘策略:当某一模态连续 **8 帧以上(persistence 8+)**检测到目标,而另一模态却完全遗漏时,系统会触发一个简单的二元判断——"这是不是一辆车?"时间持续性作为过滤条件的设计非常精妙:单帧的检测差异可能只是随机噪声或短暂遮挡,而连续 8 帧的持续检测几乎可以排除偶发性误检,说明该目标确实存在于场景中(对于检测到的模态而言),或者某种系统性偏差导致了持续误报。以 30fps 的帧率计算,8 帧约对应 0.27 秒的时间窗口,这已经足够排除传感器的瞬态噪声。
从信号处理角度看,"连续 8 帧以上"的持续性要求本质上是一个时序中值滤波器或滑动窗口投票机制。假设单帧误检率为 p,则连续 8 帧独立误检的概率为 p^8——即使单帧误检率高达 10%,8 帧连续误检的概率也只有 10^-8,几乎可以忽略。这种指数级降低误报率的特性使得时序持续性成为极其有效的后处理策略。在目标跟踪领域,类似的思想被广泛应用——如 SORT/DeepSORT 算法中的"tentative track"机制,要求目标被连续检测到 N 帧后才确认为有效轨迹。
- 如果答案是"是",则在遗漏的模态上修正边界框,一次性获得 8 个免费的漏检样本用于重训练;
- 如果答案是"否",那么这些持续检测就是被识别出的误报样本,同样具有训练价值。
这种设计的巧妙之处在于,它把两个模态当作互相监督的"裁判"。一个模态的强项恰好可以弥补另一个模态的弱项——例如红外在夜间或强光下的鲁棒性,与可见光在纹理细节上的优势形成互补。通过这种交叉验证机制,人工只需回答简单的是非题,就能持续产出高质量的困难样本。相比传统的不确定性采样(仅依赖单一模型的置信度分数来判断样本价值),这种跨模态差异驱动的方法更加鲁棒,因为它利用了物理世界的互补信息作为判断依据——两种传感器基于完全不同的物理原理工作,它们的失效模式几乎不相关,因此当一个传感器"看见"而另一个"看不见"时,这种分歧本身就携带了极高的信息量。
从信息论的角度理解,这种方法实际上是在最大化每次人工标注的信息增益(Information Gain)。随机采样的标注中,大量样本可能是模型已经能正确处理的"简单样本",对训练贡献极低;而跨模态差异筛选出的样本,几乎每一个都精准对应了至少一个模态的盲区,标注价值密度远超随机采样。
边缘采集与云端数据闭环
车载数据采集平台
数据采集依托一套车载硬件系统,核心是一块 8GB 的 Jetson Nano,集成了 GPS、IMU(惯性测量单元)和 4G 网络模块。
NVIDIA Jetson Nano 是一款面向边缘 AI 推理的嵌入式计算平台,搭载 128 核 Maxwell 架构 GPU 和四核 ARM Cortex-A57 CPU。8GB 版本(即 Jetson Nano 2GB 的升级型号,实际上可能指 Jetson Xavier NX 或 Orin Nano 系列)拥有足够的内存来同时运行多路视频流的实时推理任务,功耗仅为 5-10 瓦,可通过车载 12V/24V 电源经 DC-DC 转换后长时间稳定运行。其 CUDA 加速能力使得在边缘端就能运行轻量级目标检测模型(如 YOLOv5-nano、MobileNet-SSD 或经 TensorRT 优化后的模型),实现实时标注预判断,从而在数据上传前完成初步筛选,大幅减少需要传输和存储的数据量。在车载环境中,还需考虑工作温度范围(通常 -20°C 至 70°C)、振动耐受性和供电稳定性等工程因素。
IMU(惯性测量单元)通常包含三轴加速度计和三轴陀螺仪,有时还集成三轴磁力计。在数据采集场景中,IMU 数据的价值不仅在于记录车辆运动姿态——它还能用于判断车辆是否正在转弯、加减速或行驶在颠簸路面上,这些运动状态信息在后续的数据分析和场景分类中极为有用。例如,急转弯时摄像头视角剧烈变化,可能导致目标检测产生大量遮挡和形变,这些正是模型需要重点学习的困难场景;而 IMU 数据可以自动标记出这些运动状态,为后续的数据分层采样提供元信息。
整套系统的运行逻辑完全自动化:
- 汽车启动 → 计算机开机;
- 车辆开始移动 → 设备启动采集;
- 车辆停止超过 90 秒,或熄火 → 停止采集。
这种"随车而动"的设计避免了大量静止冗余帧(停车等红灯时连续拍摄的相似画面对训练价值极低,反而会造成数据集中的类别不平衡和场景偏倚),保证采集到的数据都是有意义的动态场景,同时 GPS 和 IMU 还为每帧数据附加了地理位置与运动姿态信息,为后续多维度分析(如按地理区域、天气条件、道路类型分层采样)提供了空间。
自动化数据处理流水线
当 Jetson 接入网络后,整套云端流程自动运转:
- 自动摄取:帧数据自动上传至服务器;
- 自动标注:用最新模型权重对新帧进行推理标注;
- 差异高亮:标记出模态间不一致的检测结果;
- 多重仲裁:对传感器分歧样本,通过 COCO 模型与一个语义推理 AI 进行二次判断——若两者都认为画面中"什么都没有",则该样本被提升至人工审核队列。
多重仲裁机制体现了"集成学习"(Ensemble Learning)的思想在数据标注中的应用。单一模型的判断可能存在系统性偏差,但当多个独立训练的模型(基于不同数据集、不同架构)对同一样本给出一致判断时,这一判断的可靠性显著提升。这里使用 COCO 预训练模型作为通用基线,语义推理 AI 作为上下文理解的补充——前者擅长识别标准物体形态,后者能理解场景语义(如"高速公路上不应该出现行人"这类逻辑约束),两者结合有效降低了自动标注的错误率。
这套流水线本质上构建了一个自我强化的数据飞轮(Data Flywheel)。数据飞轮是一个源自亚马逊飞轮效应(Jeff Bezos 的增长飞轮理论)并被特斯拉自动驾驶团队广泛实践的概念——部署的模型在真实世界中运行时不断产生新数据,这些数据经筛选标注后又用于改进模型,改进后的模型再部署采集更多数据,形成正反馈循环。飞轮效应的关键在于,随着数据量增长,模型改进的边际成本递减——自动标注准确率越来越高,需要人工介入的比例越来越低。
数据飞轮的经济学本质是学习曲线效应(Learning Curve Effect)在 AI 系统中的体现。传统制造业中,产量每翻一番,单位成本下降 15-25%;类似地,在数据飞轮中,每一轮迭代的人工标注成本都在下降——因为自动标注的准确率在提升,需要人工修正的比例在减少。据估算,从 V1 到成熟系统,每帧的等效标注成本可能从最初的数分钟降至不到一秒的人工审核时间,降幅超过两个数量级。这意味着 300 万帧数据的标注工作量,可能仅相当于传统方法标注数万帧的人力投入。
据特斯拉 2022 年 AI Day 披露,其自动标注系统的准确率已超过人工标注,而 Waymo 的 Auto-Labeling Pipeline 通过离线高精度模型对在线模型的预测进行回溯修正,实现了大规模 3D 点云的自动标注。本文作者以个人项目的规模复现了类似的闭环机制,证明了方法论的通用性——核心不在于拥有数十万 GPU 小时的算力,而在于设计一个能持续自我改进的系统架构。
自有数据集的长期价值与扩展性
作者提到,目前数据集仅分为"车辆"和"人类"两个类别,但随着数据量的积累,未来可以随时拆分出更细粒度的类别(例如将"车辆"细分为轿车、SUV、卡车、摩托车、自行车等子类别)。他形象地比喻道:"这就是拥有自己数据集的美妙之处——你可以随时按任何方式切分这块蛋糕。"
这种从粗到细的标签演进策略在机器学习中被称为"层次化标注"(Hierarchical Labeling)。其核心优势在于:早期用粗粒度标签快速积累数据量,建立基本的检测能力;当特定细分类别的需求出现时,只需对已有数据进行重新分类(re-labeling),而无需重新采集——因为原始图像数据和检测框位置已经完备,仅需补充分类标签。这种策略大幅降低了前期标注成本,同时保留了未来扩展的全部灵活性。
他还计划加入更多模态,例如 SWIR(短波红外),进一步丰富传感器融合的维度。短波红外覆盖 0.9-2.5 微米波段,介于可见光(0.4-0.7 微米)和 LWIR(8-14 微米)之间,具备几个独特优势:能穿透薄雾、烟尘和某些遮挡物(因为该波段的 Mie 散射效应远弱于可见光);可检测水分含量差异(水在 1.4 和 1.9 微米处有强吸收峰,用于识别路面湿滑或积水);能透过深色车窗玻璃观察车内情况(可见光被车窗着色膜阻挡,但 SWIR 可穿透);以及在低光环境下利用自然星光辐射(夜空气辉,Nightglow)成像,无需主动照明。近年来 InGaAs(铟镓砷)探测器成本下降,使得 SWIR 相机逐渐从军事专用走向商业应用。将 RGB、LWIR 和 SWIR 三种模态组合,可以覆盖从纹理识别到热特征检测再到恶劣天气穿透的完整感知维度,构成高度互补的传感器阵列——三者的失效场景几乎没有交集,理论上能实现全天候、全场景的目标检测鲁棒性。
这个案例对广大开发者的启示是深刻的:
- 数据主权带来灵活性。当你完全掌控数据的采集、标注和结构时,可以根据业务演进自由调整标签体系,而无需受限于公开数据集的固有分类。在数据隐私法规(如 GDPR、中国数据安全法)日趋严格的背景下,拥有自采数据还意味着完全可控的合规链路。
- 半自动化是个人项目的破局关键。通过模型自标注 + 交叉验证 + 人工兜底的组合,单个工程师也能处理百万级数据规模。这一方法论的核心在于将人工劳动从"逐帧标注"转变为"异常仲裁"——前者的工作量与数据量线性增长,后者则随模型改进而指数级下降。
- 多模态互补设计。利用不同传感器的物理特性差异来构建自动纠错机制,比单纯堆叠标注人力更加高效和优雅。这一思路可以推广到任何存在信息互补的多源数据场景——例如文本与图像的跨模态校验、雷达与相机的融合标注等。
结语
从 500 帧手工标注起步,到 300 万帧的自动化数据闭环,这个项目展示了扎实的工程思维如何将"没有合适数据集"这一难题,转化为一个可持续演进的数据资产。在大模型时代,算力和算法日益普及,而高质量、场景专属的数据正成为真正的护城河。Andrew Ng(吴恩达)近年来大力倡导的"以数据为中心的 AI"(Data-Centric AI)运动正是这一趋势的学术表达——与其反复调整模型架构和超参数,不如把同等精力投入到系统性地改善数据质量上。这位工程师的实践证明:数据集不必等待别人来提供,动手造一个,反而能收获更深入的理解与掌控力。
核心要点
相关推荐

李飞飞谈AI:视觉智能、创造力边界与人类主体性
斯坦福教授李飞飞在Huberman Lab播客深度解析AI与视觉科学的关系,探讨ImageNet如何引爆现代AI,阐述AI的能力边界、医疗应用前景,以及为何人类主体性是AI发展的核心命题。

DeepSeek Harness实测:插件化Agent框架的核心优势解析
深入实测DeepSeek Harness开源Agent框架,解析其插件化架构设计、编码能力、安装部署方式及与Claude Code的对比,帮助开发者了解这款可扩展Agent开发底座的真正价值。

10美元搭建50万域名搜索引擎:独立开发者的周末项目启示
一位独立开发者仅用一个周末和10美元成本,搭建了覆盖50万域名的垂直搜索引擎。本文深入分析低成本搜索引擎背后的技术栈、垂直搜索的差异化机会,以及独立开发者快速验证想法的方法论。