PaddleSeg PanopticSeg 工具箱公开数据集准备指南:Cityscapes 与 MS COCO 全景分割数据预处理全流程

发布时间:2026/9/25 13:38:09

PaddleSeg PanopticSeg 工具箱公开数据集准备指南:Cityscapes 与 MS COCO 全景分割数据预处理全流程 人工智能计算机视觉预训练【免费下载链接】PaddleSegEasy-to-use image segmentation library with awesome pre-trained model zoo, supporting wide-range of practical tasks in Semantic Segmentation, Interactive Segmentation, Panoptic Segmentation, Image Matting, 3D Segmentation, etc.项目地址https://gitcode.com/gh_mirrors/pa/PaddleSeg点击查看免费下载全景分割Panoptic Segmentation需要同时输出每个像素的语义类别与每个 thing 类实例的编号其训练数据既要有语义级标注也要有实例级标注因此公开数据集的预处理比普通语义分割更复杂。本文以 PaddleSeg 仓库内contrib/PanopticSeg全景分割工具箱的 tools/data/README.md 为骨架完整讲解 Cityscapes 与 MS COCO 两大公开数据集的下载、全景标注生成、文件列表创建与目录规整全流程并结合paddlepanseg/datasets与tools/data下的源码说明文件列表与标注 JSON 是如何被底层 Dataset 消费的。读完本文你将能够独立完成这两个数据集的全景分割预处理并顺利衔接该工具箱的训练、验证与推理流程。一、全景分割数据准备先理解工具箱的数据约定在动手下载数据之前有必要先明确工具箱对数据的统一约定这决定了后续每一步操作的产物形态。1. 文件列表file list与 PaddleSeg 主库一致contrib/PanopticSeg为每个子集train / val维护一个纯文本文件列表每行代表一个样本包含一对由单个空格分隔的路径第一个路径指向原始图像第二个路径指向全景分割标签图编码在 RGB 图像中。示例来自 full_features_en.mdval2017/000000001000.jpg panoptic_val2017/000000001000.png val2017/000000001268.jpg panoptic_val2017/000000001268.png2. 全景标签的 RGB 编码协议全景标签图中每个像素的 R、G、B 通道按如下公式编码一个唯一的pan_id见 encoding_protocol_en.mdr id % 256 g id // 256 % 256 b id // (256 * 256) % 256其中id即pan_id。对 thing 类pan_id (cat_id 1) * label_divisor ins_id对 stuff 类pan_id (cat_id 1) * label_divisor未知标签pan_id 0。label_divisor为预定义常量默认值1000在base_dataset.py与各配置文件中均可见。3. 标注 JSON除文件列表外训练/验证还需要 COCO 风格的全景标注 JSONannotations下的segments_info与images信息工具箱在读取样本时会将其与文件列表按image_id关联。理解了这三项约定就可以按部就班地准备数据集了。二、Cityscapes 数据集准备全流程Cityscapes 是自动驾驶街景解析的经典基准也是 Panoptic-DeepLab 等模型的主要训练数据。整个准备过程分为四步下载原始数据 → 生成全景标注 → 生成文件列表 → 规整目录。2.1 下载并核对原始目录结构从 Cityscapes 官方网站下载数据集需要注册并同意许可协议。下载完成后原始数据应呈现如下结构{PATH_TO_CITYSCAPES_DATASET} ├── gtFine │ ├── test │ ├── train │ └── val └── leftImg8bit ├── test ├── train └── val其中leftImg8bit为 8bit 左视相机图像gtFine为精细标注包含语义标注与实例标注的源文件。2.2 使用 cityscapesScripts 生成全景分割标注Cityscapes 原始标注并不直接提供全景分割标签需要使用官方配套工具cityscapesScripts中的脚本生成# 在 cityscapesScripts 仓库根目录执行 python preparation/createPanopticImgs.py该脚本会读取gtFine下的语义/实例标注合并输出全景分割标签。关键注意事项处理训练子集时必须指定--use-train-id否则生成的标签将使用原始类别 id 而非训练 id导致后续训练时类别索引错乱。验证子集按官方默认方式处理即可。生成后gtFine目录下会新增cityscapes_panoptic_train_trainId/、cityscapes_panoptic_val/、cityscapes_panoptic_test/三个标签目录以及对应的cityscapes_panoptic_train_trainId.json、cityscapes_panoptic_val.json、cityscapes_panoptic_test.json三个标注文件这一结构在 create_cityscapes_file_lists.py 的 docstring 中有明确注释。2.3 生成文件列表切换到本仓库根目录即contrib/PanopticSeg执行python tools/data/create_cityscapes_file_lists.py --data_dir {PATH_TO_CITYSCAPES_DATASET} --out_dir {PATH_TO_CITYSCAPES_DATASET}该脚本会在--out_dir指定的目录下生成train_list.txt与val_list.txt两个文件列表。结合 create_cityscapes_file_lists.py 的源码其参数与行为如下参数默认值说明--data_dir必填数据集根目录即包含leftImg8bit与gtFine的目录--out_dir./文件列表输出目录--sep空格文件列表行内两个路径之间的分隔符核心逻辑源码第 45-63 行对train与val两个子集分别处理训练子集的全景标签目录固定取gtFine/cityscapes_panoptic_train_trainId验证子集取gtFine/cityscapes_panoptic_{subset}与上一步--use-train-id的产物一一对应通过glob分别收集leftImg8bit/{subset}/*/*.png注意 Cityscapes 按城市/序列二级目录组织因此是两级通配与gtFine/{subdir}/*.png并各自排序后按索引配对若图像数量与标签数量不一致直接raise RuntimeError中止避免静默生成错位数据每行写入相对于data_dir的路径对例如leftImg8bit/train/aachen/aachen_000000_000019_leftImg8bit.png gtFine/cityscapes_panoptic_train_trainId/aachen_000000_000019_gtFine_panoptic.png。2.4 建立软链接并核对最终结构在contrib/PanopticSeg下创建软链接也可直接复制整个目录ln -s {PATH_TO_CITYSCAPES_DATASET} data/cityscapes最终data/cityscapes应呈现如下结构这与 Panoptic-DeepLab 配置文件 中dataset_root: data/cityscapes、json_path: data/cityscapes/gtFine/cityscapes_panoptic_train_trainId.jsonval 对应cityscapes_panoptic_val.json的引用完全吻合data/cityscapes ├── gtFine │ ├── cityscapes_panoptic_test │ ├── cityscapes_panoptic_trainId │ ├── cityscapes_panoptic_val │ ├── test │ ├── train │ ├── val │ ├── cityscapes_panoptic_test.json │ ├── cityscapes_panoptic_train_trainId.json │ └── cityscapes_panoptic_val.json ├── leftImg8bit │ ├── test │ ├── train │ └── val ├── train_list.txt └── val_list.txt注意README 中该目录树的cityscapes_panoptic_trainId一项与脚本实际使用的目录名cityscapes_panoptic_train_trainId在仓库不同文档中写法略有出入实际训练时以配置文件中json_path与脚本 glob 的目录名为准请确保两者一致。三、MS COCO 数据集准备全流程MS COCO 是实例分割与全景分割领域覆盖面最广的数据集也是 Mask2Former 等模型的训练基准。本工具箱使用 2017 版本划分splits。3.1 下载并核对原始目录结构从 COCO 官方网站下载 2017 版本数据。除常规的train2017/val2017图像外还需要全景分割专用资源panoptic_train2017/、panoptic_val2017/标签图目录以及annotations下的panoptic_train2017.json、panoptic_val2017.json标注文件。预期结构{PATH_TO_COCO_DATASET} ├── annotations │ ├── panoptic_train2017.json │ └── panoptic_val2017.json ├── panoptic_train2017 ├── panoptic_val2017 ├── train2017 └── val20173.2 生成文件列表切换到contrib/PanopticSeg根目录执行python tools/data/create_coco_file_lists.py --data_dir {PATH_TO_COCO_DATASET} --out_dir {PATH_TO_COCO_DATASET}与 Cityscapes 脚本对称create_coco_file_lists.py 同样接受--data_dir、--out_dir默认./、--sep默认空格三个参数。其核心逻辑源码第 38-51 行对train/val两个子集分别处理图像通过glob匹配{subset}2017/*.jpgCOCO 图像直接平铺在子集目录下无二级目录标签通过glob匹配panoptic_{subset}2017/*.png同样在数量不一致时raise RuntimeError写入相对data_dir的路径对例如train2017/000000000009.jpg panoptic_train2017/000000000009.png。3.3 建立软链接并核对最终结构ln -s {PATH_TO_COCO_DATASET} data/coco最终data/coco结构如下与 Mask2Former 配置文件 中dataset_root: data/coco、file_list: data/coco/train_list.txt、json_path: data/coco/annotations/panoptic_train2017.json的引用完全一致data/coco ├── annotations │ ├── panoptic_train2017.json │ └── panoptic_val2017.json ├── panoptic_train2017 ├── panoptic_val2017 ├── train2017 ├── val2017 ├── train_list.txt └── val_list.txt四、底层机制文件列表与标注 JSON 如何被 Dataset 消费理解了生成什么之后再看谁来消费、如何消费有助于排查路径或格式问题。contrib/PanopticSeg的数据集基类位于 paddlepanseg/datasets/base_dataset.pyPanopticDataset是基类COCOStylePanopticDataset继承并扩展了对 COCO 风格全景 JSON 的支持_read_sample_list()源码第 144-190 行打开json_path指定的 JSON分别建立annotations按image_id索引与images按id索引两个字典随后逐行读取file_list按self.sep即脚本中的--sep切分每行得到[image_path, label_path]两段若格式不合法非两段在 train/val 模式下会抛出ValueError每个样本的image_id从图像路径解析而来据此从 JSON 中取出height、width以及segments_info并对每个 segment 执行convert_id_for_train类别映射、剔除ignore_index默认 255的项后写入sample[ann]类别的 thing/stuff 属性与thing_ids由各子类内置的CATEGORY_META_INFO见 cityscapes.py 与 coco.py推导这也是模型区分实例与背景的关键输入。因此文件列表中路径的书写必须与dataset_root的相对关系正确且两列的顺序必须是图像在前、标签在后任何颠倒都会在_read_sample_list阶段暴露出来。五、从数据到训练配置文件中的引用关系数据就绪后训练配置通过train_dataset/val_dataset两个字段把上述产物串联起来。以 Panoptic-DeepLab 配置 为例train_dataset: type: CityscapesTrain dataset_root: data/cityscapes file_list: data/cityscapes/train_list.txt json_path: data/cityscapes/gtFine/cityscapes_panoptic_train_trainId.json label_divisor: 1000 num_classes: 19 ignore_index: 255 val_dataset: type: Cityscapes dataset_root: data/cityscapes file_list: data/cityscapes/val_list.txt json_path: data/cityscapes/gtFine/cityscapes_panoptic_val.json label_divisor: 1000 num_classes: 19COCO 侧同理见 Mask2Former 配置train_dataset: type: COCO dataset_root: data/coco file_list: data/coco/train_list.txt json_path: data/coco/annotations/panoptic_train2017.json另外注意两个配置的训练变换列表都以ConvertRGBToID开头——这印证了前面提到的 RGB 编码约定标签 PNG 先由 RGB 还原为pan_id单通道图再进入后续的缩放、裁剪、目标生成GeneratePanopticDeepLabTrainTargets/GenerateMaskFormerTrainTargets等变换。若自行制作自定义数据集参考 full_features_en.md 的 2.2 节也必须遵守同样的 RGB 编码与文件列表格式。六、常见问题与排查建议脚本报RuntimeErrorcreate_cityscapes_file_lists.py与create_coco_file_lists.py在图像/标签数量不一致时直接抛错。请检查全景标签是否已完整生成、目录命名是否正确Cityscapes 训练子集必须是cityscapes_panoptic_train_trainId以及下载的数据是否有缺失。训练子集忘记--use-train-id生成 Cityscapes 全景标签时若不指定该选项训练子集将使用原始类别 id导致类别索引与配置的num_classes: 19及convert_id_for_train映射不匹配。文件列表路径相对性两个脚本写入的是相对data_dir的路径因此--data_dir必须传数据集根目录若传错层级Dataset 拼接dataset_root后会找不到文件。软链接 vs 复制文档两种方式均可。软链接节省磁盘且便于多个实验共享数据但需保证链接目标长期有效训练前可用ls data/cityscapes/train_list.txt等命令快速验证。自定义分隔符脚本默认使用空格base_dataset.py默认separator 若通过--sep修改需保证配置文件/数据集构造处保持一致默认情况下无需改动。完成以上两步公开数据集的预处理后即可直接运行python tools/train.py --config {CONFIG_PATH}开始训练或参考 quick_start_en.md 使用预训练权重进行推理验证。赞分享人工智能计算机视觉预训练【免费下载链接】PaddleSegEasy-to-use image segmentation library with awesome pre-trained model zoo, supporting wide-range of practical tasks in Semantic Segmentation, Interactive Segmentation, Panoptic Segmentation, Image Matting, 3D Segmentation, etc.项目地址https://gitcode.com/gh_mirrors/pa/PaddleSeg点击查看免费下载相关推荐PaddleSeg 全景分割工具包PanopticSeg完整使用指南从环境安装、数据集准备到训练与部署PaddleSeg 全景分割工具包PanopticSeg完整使用指南从环境安装、数据集准备到训练与部署 本指南围绕 PaddleSeg 仓库下的独立子项目人工智能计算机视觉预训练如何启动 KTransformers v0.2.4 的 balance_serve 多并发推理服务并调用 API如何启动 KTransformers v0.2.4 的 balance_serve 多并发推理服务并调用 API 如果你已经安装过 KTransformers人工智能计算机视觉预训练PaddleSeg 全景分割工具箱开发指南目录结构、InfoDict 数据结构与自定义数据集开发PaddleSeg 全景分割工具箱开发指南目录结构、InfoDict 数据结构与自定义数据集开发 本指南面向希望为全景分割工具箱PaddleSeg 生态下的人工智能计算机视觉预训练创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/25 13:38:09

Python-面向对象编程

今日目标:理解 OOP 思想,掌握类与对象、封装、继承、多态,完成愤怒的小鸟案例设计一、面向过程 vs 面向对象面向过程面向对象(OOP)按步骤组织代码按对象组织代码函数是核心类是核心适合简单任务适合复杂系统面向对象三…

2026/9/25 13:33:09

Sybase ASA 12.0 解压即用客户端实战指南

简介:本资源是Sybase Adaptive Server Anywhere(ASA)12.0官方客户端工具的绿色免安装版本,专为数据库开发、运维及DBA人员设计,用于连接、管理与调试ASA/SAP SQL Anywhere数据库系统。解压即用,内置JRE运行…

2026/9/25 19:53:27

清华唐杰大模型课程改革:从理论到全链路实操项目

1. 这门课到底在教什么:从“听讲座”到“交作业”的转变唐杰老师在清华开课不算新闻,但这次把课程内容整个翻新,让学生直接上手跑通大模型全链路,这件事值得细说。我翻了一圈流出的课程大纲和学生的零散反馈,核心变化就…

2026/9/25 19:53:27

企业知识库AI私有化部署:RAG落地的六大工程决策

1. 项目概述:为什么要聊这 6 个工程决策企业知识库 AI 私有化部署,这两年几乎是每个有点规模的公司都在问的事。业务部门拿着 ChatGPT 演示说“你看这玩意多好用”,IT 部门一听要把内部文档喂给外部 API,直接摇头。两边拉锯的结果…

2026/9/25 19:53:27

LLM应用安全护栏实战:从线上事故到可复用架构

1. 从一次线上事故说起:为什么LLM应用必须加护栏去年年底,我参与的一个智能客服项目上线第三天就出了状况。用户问“帮我查一下上个月的订单”,模型返回了一段看起来很像订单信息的JSON,但里面的金额、订单号全是编造的。前端没做…

2026/9/25 19:48:26

2024数学建模A题板凳龙:运动学模型、欧拉法代码与论文排版全解析

简介:这份资源是2024年全国大学生数学建模竞赛A题“板凳龙”的完整参赛成果,包含一篇Word论文与配套源代码,面向具备数学建模与编程基础的高校学生及研究人员,尤其适合关注运动学建模、路径优化与数值求解的群体。压缩包内共1个do…

2026/9/24 20:24:47

GAMP 5 基于风险的计算机化系统验证:软件分类与审计追踪实践

简介:《A Risk-Based Approach to Compliant GxP Computerized Systems》即业内熟知的GAMP 5指南,面向制药企业质量与IT合规人员、验证工程师及计算机化系统管理者,用于解决GxP法规环境下系统合规性难以科学落地的问题。文档以风险管理为主线…

2026/9/23 12:06:55

安全托管MSSP实战:从静态防御到人机协同的攻防运营与应急响应

简介:这份PPT围绕互联网业务安全托管服务展开,面向企业安全负责人、IT运维人员及关注MSSP/MSS选型的读者,重点回应传统安全过度依赖人工、碎片化静态防御难以对抗产业化攻击等痛点。资源共1个pptx文件,包体约30.63MB,以…

2026/9/25 0:02:35

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:02:35

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:02:35

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/22 16:34:32

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/25 18:41:36

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/25 18:34:56

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑