一帧自动驾驶点云要框40秒?CVAT LiDAR点云标注给出了答案
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
一帧LiDAR(激光雷达)点云有50万个点,人工框一辆车平均要40秒,三千帧的数据集足以拖垮标注团队。CVAT LiDAR点云标注就是冲着这个瓶颈做的。
它到底能做什么
CVAT本来是做通用视觉标注的,3D不是后加的插件,而是从底层就按一等公民设计的。点云任务里可以挂摄像头图像,标注体是真正的三维cuboid,不是2D框在画面上投影出来的假象。渲染部分由独立的cvat-canvas3d模块承担,和2D画布互不干扰。
- 标注体分单帧cuboid和cuboid track(跨帧连续框)两类,外加摄像头context image
- 画布同时给透视主视图和Top/Side/Front三个投影,任一改都全局同步
- 点云和图像可以放进同一个任务,导出的数据集保持时序对齐
- 界面上能做的事,SDK和REST接口都能做,批量脚本友好
- 多模态对齐发生在导入阶段,标注时直接用,不用自己写胶水代码
一帧自动驾驶3D标注的完整链路:从拿到数据到交付
下面按真实操作顺序走一遍,假设是城市道路采集的数据。
📦 喂数据:LiDAR数据预处理比想象中重要
把点云文件传进CVAT建任务。最常见的是.pcd,测试数据里也能看到.bin这类原始格式。如果目录里带同名的相机图片,CVAT会自动认作related images,并在3D视图里挂成context image。说白了,文件命名和帧序对齐,这一步决定后面顺不顺手。
| 上传内容 | 在标注链路里的角色 |
|---|---|
| .pcd / .bin 点云 | 标注主体,cuboid框的就是它 |
| 相机帧(related_images) | 以context image形式嵌在3D视图里辅助定label |
| 标签与属性定义 | 决定每个cuboid能带哪些元数据 |
框第一个目标
进入3D模式选cuboid工具。在透视视图里拉出初框,把目标和大致高度定下来;切到Top视图校航向角,Side/Front视图里核对宽和高。尺寸也可以直接填数字,标准轿车就是4.2米宽那种量级。
顺着时序拖过去
关键帧框完,靠插值把cuboid track铺到中间帧,再逐帧抽查修正。仓库里有一份插值说明讲得很细。一百帧的时序,实际动手的往往只有十几帧。
质检与返工
交付前有两道检查。一道是consensus:同一帧让两个人标,系统对比差异;另一道是QA指标,平台算出两套结果的相似度,把冲突帧直接列出来。拿冲突清单返工,比抽查高效得多。
三个容易被忽略的细节
四视图同步不是装饰
现象:透视视图里转箱子,Top/Side/Front里的矩形跟着动,而且每个视图都能直接拖。原因:底层的3D数据模型是唯一真相源,四个视图只是同一对象的投影。收益:不用"切到顶视图看一眼再切回来",一次调整全局生效。
context image解决"那到底是个啥"
现象:纯点云没颜色没纹理,货车和工程车经常分不清。原因:related_images在导入时就按时间戳对齐了,悬停点云目标时旁边就是同刻的相机画面。收益:定label靠看实物,而不是靠脑补。3D任务工作区文档里有专门说明。
数字输入让"尺寸精度"可考核
现象:cuboid编辑支持直接输入宽、高、长数值。原因:拖拽有手抖,数值输入没有。收益:验收时"尺寸误差±5%"这类条款,用数字框基本稳过。
谁在用它、用来做什么
城市道路数据采集:给感知模型标车辆和行人3D框。2D框没有深度和航向,感知模块用不上;CVAT让点云和相机帧在同一任务里标完,导出的多模态数据集天然对齐,不用在两个工具间倒数据。
高精地图制作:路灯、电杆这类设施要跨帧尺寸一致。用cuboid track一次标注整条路线,插值后只修正少数关键帧,成品一致性比逐帧重画稳得多。
机器人与移动平台:服务机器人的导航数据集点位小、视野窄,工作流和车端几乎一样,只是标签集不同。四视图那套交互可以直接复用。
⚙️ 上手之前要知道的几件事
- 部署用docker compose即可,后端是Django + Postgres + Redis,服务划分看docker-compose.yml
- 浏览器WebGL内存是第一瓶颈,单帧十几万点属正常量级,长序列注意控制同时打开的视图
- 用过2D标注的话,3D一下午能上手,U/I/O/J/K/L这组快捷键用熟了效率翻倍
- 重复性工作走SDK或CLI建任务、导数据集,别点鼠标
- 导出格式不止CVAT自家一种,点云导出实现可以对照下游需求选
CVAT整个代码库开源,自建部署没有按席位计费这一说,对长跑的自动驾驶数据项目,这是实打实的成本优势。
【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考