一帧自动驾驶点云要框40秒?CVAT LiDAR点云标注给出了答案

发布时间:2026/9/10 14:20:11
一帧自动驾驶点云要框40秒?CVAT LiDAR点云标注给出了答案 一帧自动驾驶点云要框40秒CVAT LiDAR点云标注给出了答案【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat一帧LiDAR激光雷达点云有50万个点人工框一辆车平均要40秒三千帧的数据集足以拖垮标注团队。CVAT LiDAR点云标注就是冲着这个瓶颈做的。它到底能做什么CVAT本来是做通用视觉标注的3D不是后加的插件而是从底层就按一等公民设计的。点云任务里可以挂摄像头图像标注体是真正的三维cuboid不是2D框在画面上投影出来的假象。渲染部分由独立的cvat-canvas3d模块承担和2D画布互不干扰。标注体分单帧cuboid和cuboid track跨帧连续框两类外加摄像头context image画布同时给透视主视图和Top/Side/Front三个投影任一改都全局同步点云和图像可以放进同一个任务导出的数据集保持时序对齐界面上能做的事SDK和REST接口都能做批量脚本友好多模态对齐发生在导入阶段标注时直接用不用自己写胶水代码一帧自动驾驶3D标注的完整链路从拿到数据到交付下面按真实操作顺序走一遍假设是城市道路采集的数据。 喂数据LiDAR数据预处理比想象中重要把点云文件传进CVAT建任务。最常见的是.pcd测试数据里也能看到.bin这类原始格式。如果目录里带同名的相机图片CVAT会自动认作related images并在3D视图里挂成context image。说白了文件命名和帧序对齐这一步决定后面顺不顺手。上传内容在标注链路里的角色.pcd / .bin 点云标注主体cuboid框的就是它相机帧related_images以context image形式嵌在3D视图里辅助定label标签与属性定义决定每个cuboid能带哪些元数据框第一个目标进入3D模式选cuboid工具。在透视视图里拉出初框把目标和大致高度定下来切到Top视图校航向角Side/Front视图里核对宽和高。尺寸也可以直接填数字标准轿车就是4.2米宽那种量级。顺着时序拖过去关键帧框完靠插值把cuboid track铺到中间帧再逐帧抽查修正。仓库里有一份插值说明讲得很细。一百帧的时序实际动手的往往只有十几帧。质检与返工交付前有两道检查。一道是consensus同一帧让两个人标系统对比差异另一道是QA指标平台算出两套结果的相似度把冲突帧直接列出来。拿冲突清单返工比抽查高效得多。三个容易被忽略的细节四视图同步不是装饰现象透视视图里转箱子Top/Side/Front里的矩形跟着动而且每个视图都能直接拖。原因底层的3D数据模型是唯一真相源四个视图只是同一对象的投影。收益不用切到顶视图看一眼再切回来一次调整全局生效。context image解决那到底是个啥现象纯点云没颜色没纹理货车和工程车经常分不清。原因related_images在导入时就按时间戳对齐了悬停点云目标时旁边就是同刻的相机画面。收益定label靠看实物而不是靠脑补。3D任务工作区文档里有专门说明。数字输入让尺寸精度可考核现象cuboid编辑支持直接输入宽、高、长数值。原因拖拽有手抖数值输入没有。收益验收时尺寸误差±5%这类条款用数字框基本稳过。谁在用它、用来做什么城市道路数据采集给感知模型标车辆和行人3D框。2D框没有深度和航向感知模块用不上CVAT让点云和相机帧在同一任务里标完导出的多模态数据集天然对齐不用在两个工具间倒数据。高精地图制作路灯、电杆这类设施要跨帧尺寸一致。用cuboid track一次标注整条路线插值后只修正少数关键帧成品一致性比逐帧重画稳得多。机器人与移动平台服务机器人的导航数据集点位小、视野窄工作流和车端几乎一样只是标签集不同。四视图那套交互可以直接复用。⚙️ 上手之前要知道的几件事部署用docker compose即可后端是Django Postgres Redis服务划分看docker-compose.yml浏览器WebGL内存是第一瓶颈单帧十几万点属正常量级长序列注意控制同时打开的视图用过2D标注的话3D一下午能上手U/I/O/J/K/L这组快捷键用熟了效率翻倍重复性工作走SDK或CLI建任务、导数据集别点鼠标导出格式不止CVAT自家一种点云导出实现可以对照下游需求选CVAT整个代码库开源自建部署没有按席位计费这一说对长跑的自动驾驶数据项目这是实打实的成本优势。【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考