CVAT 做 LiDAR 点云标注的实践指南:如何把 3D 边界框打准
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
CVAT(Computer Vision Annotation Tool)是一个开源的视觉数据标注平台,它的 3D 任务类型可以直接处理 LiDAR 点云标注:在浏览器里对点云逐帧放置 3D 立方体,是自动驾驶数据制作中常见的工具。这篇文章讲一遍从点云导入到 3D 框交付的完整路径。
场景:给一段城市道路点云打 3D 框
想象一个实际场景:一段城市道路采集数据,每帧点云有几十万甚至上百万个点,你需要给一辆横穿马路的行人和路边两辆停着的车打上 3D 框,要求框的中心、尺寸、朝向都对得上真实物体。
难的地方有三个。一是数据量大,单帧点数多、帧数又多,逐帧检查的工作量很大。二是精度敏感,3D 框由位置、尺寸、朝向共同确定,任何一项偏了,这条训练标签就是错的。三是对齐问题,城市场景里目标经常被前车或植被遮挡,只靠一个视角确认不了位置和高度,需要多个视角甚至相机图像做参照。
CVAT 的 3D 任务就是围绕这件事设计的:它把点云、相机图像一起导入,用四视图联动的方式辅助定位,再配合任务分工和复核流程交付结果。
🔍 CVAT 在 3D 标注里能做什么
| 能力维度 | 具体提供 | 解决什么 |
|---|---|---|
| 数据导入 | 支持 PCD、BIN 等点云格式,相机图像可与点云同目录同名一并导入 | 多传感器数据按帧对齐 |
| 标注画布 | 透视主窗口,加 Top、Side、Front 三个投影窗口 | 从不同方向确认 3D 框位置与高度 |
| 标注形状 | 立方体 Shape(单帧检测)与 Track(跨帧插值跟踪) | 静态目标与移动目标 |
| 对象属性 | 按标签配置属性,支持外观、属性、操作菜单 | 目标的细粒度描述 |
| 协作与导出 | 任务拆分为 job 分配到人,支持结果导出 | 团队分工与结果交付 |
从导入点云到交付标注:四步走
第一步,准备数据。点云用 PCD 或 BIN 格式即可。想同时导入相机图像做参照,把图像与点云放在同一目录、使用同名文件:
scene/ pointcloud1.pcd pointcloud1.jpg # 同一帧的相机图像 pointcloud2.pcd pointcloud2.jpgKITTI 数据集的目录布局也受支持。创建任务时选 3D 类型,CVAT 会把每帧点云解析为任务里的一帧。
第二步,选择视图。主画布是透视窗,侧边的 Top、Side、Front 投影窗只展示当前选中的对象,且始终以该立方体为中心,是精调位置和朝向的主要窗口。
第三步,绘制标注。在对象面板选 "Draw new cuboid",选定标签和 Shape 或 Track,把立方体放到点云场景中:先在投影窗里调轮廓,再拖动四个角点改尺寸,用中心点拖拽调整朝向。如果目标跨多帧,选 Track 模式,CVAT 会用插值预测中间帧的位置并维持同一 ID,你只需在关键帧上校对。
第四步,提交复核。job 完成后把 Stage 切到 Validation 交给复核人,复核通过的任务才能导出标注结果。
团队分工:3D 任务的复核怎么做
任务创建后会被拆成多个 job,可以分配给不同标注员并行处理不同帧段;Owner、Assignee、Maintainer 几种角色各有权限,复核人由任务负责人指派。job 的 Stage 在 Annotation 和 Validation 之间切换,就形成"一人标注、另一人复核"的基本分工。
两点提醒,避免踩坑:CVAT 的 Review mode(带 Issue 问题上报的工具集)目前不适用于 3D 任务,基于共识的多次标注合并也还不支持立方体这类 3D 形状。所以 3D 点云任务的质量控制,主要靠 job 指派加复核阶段的逐帧回查,而不是 2D 那套问题工单流程。
写在最后
CVAT 把 LiDAR 点云标注变成了一条浏览器内的流水线:多视图定位、立方体形状与跟踪、团队复核分工都在一套工具里完成。建议下一步先读一遍3D object annotation官方文档,再用一组小规模点云完整跑一遍流程。如果对画布本身的实现感兴趣,cvat-canvas3d/src/typescript 下的源码是最好的教材。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考