MTTR数据准备完全指南:三大数据集下载、组织与预处理一次搞定

发布时间:2026/8/18 15:19:16
MTTR数据准备完全指南:三大数据集下载、组织与预处理一次搞定 MTTR数据准备完全指南:三大数据集下载、组织与预处理一次搞定【免费下载链接】MTTR项目地址: https://gitcode.com/gh_mirrors/mt/MTTRMTTR(Multimodal Transformers for Referring Video Object Segmentation)是CVPR 2022发表的端到端指代视频目标分割框架,它能让模型根据一句自然语言描述(比如左边穿红衣服的人),在视频中逐帧分割出对应目标。想跑通MTTR的训练和评估,最让人头疼的往往不是模型本身,而是数据准备:三大数据集(A2D-Sentences、JHMDB-Sentences、Refer-YouTube-VOS)的下载、目录组织与预处理。这篇MTTR数据准备完全指南,将用一份可照抄的清单,帮你一次搞定所有环节。一图看懂:MTTR需要哪三大数据集 MTTR的代码按数据集拆成了三个独立配置,每个数据集的角色各不相同:数据集用途数据形态规模对应配置A2D-Sentences训练 测试视频 文本 h5掩码3782 段视频、6655 条文本标注configs/a2d_sentences.yamlJHMDB-Sentences仅评估(不训练)帧图片 puppet_mask掩码 文本928 条文本标注configs/jhmdb_sentences.yamlRefer-YouTube-VOS训练 竞赛评估帧图片 PNG掩码 JSON文本训练 3471 个视频、验证 202 个configs/refer_youtube_vos.yaml 三个数据集都来自同一篇论文(A2D 作者发布的 Actor-Action 系列),前两个可在论文主页找到下载入口,第三个则需要注册竞赛才能获取。第一步:克隆项目并了解目录约定 ️先克隆MTTR仓库到本地:git clone https://gitcode.com/gh_mirrors/mt/MTTR克隆完成后,数据集的放置位置有硬性约定:三个数据集目录必须与代码仓库平级或位于仓库内,具体以代码读取路径为准(默认是./a2d_sentences、./jhmdb_sentences、./refer_youtube_vos)。各数据集的读取逻辑分别写在datasets/a2d_sentences/a2d_sentences_dataset.py、datasets/jhmdb_sentences/jhmdb_sentences_dataset.py和datasets/refer_youtube_vos/refer_youtube_vos_dataset.py中,组织目录前可以先瞄一眼这些文件确认路径。A2D-Sentences 数据集:下载与目录组织 A2D-Sentences 是MTTR的主训练集,由视频 逐帧实例掩码 每实例一句文本描述组成。下载要点按论文主页指引下载后,你会拿到Release/(视频与元数据)和text_annotations/(文本与掩码)两大部分。注意:代码中读取视频的路径是Release/clips320H,请确保下载后目录名与之一致。标准目录结构a2d_sentences/ ├── Release/ │ ├── videoset.csv (视频元数据,3782 行) │ └── clips320H/ │ └── *.mp4 (视频文件) └── text_annotations/ ├── a2d_annotation.txt (文本标注,6655 行) ├── a2d_missed_videos.txt └── a2d_annotation_with_instances/ └── */ (视频文件夹) └── *.h5 (逐帧掩码标注)预处理:自动生成 COCO 格式标注 ✨A2D-Sentences 的掩码是.h5格式,而评估指标(mAP)需要 COCO 格式的 ground truth。好消息是这一步完全自动:首次以test子集运行评估时,代码会自动调用datasets/a2d_sentences/create_gt_in_coco_format.py,生成datasets/a2d_sentences/a2d_sentences_test_annotations_in_coco_format.json。如果你只想手动生成,直接运行该脚本即可。⚠️ 生成过程依赖videoset.csv恰好 3782 行、a2d_annotation.txt恰好 6655 行,若数量不符会直接报错,请检查下载是否完整。JHMDB-Sentences 数据集:图片 掩码 文本 ️JHMDB-Sentences 仅用于评估(论文里用 A2D 预训练模型直接迁移,不支持训练)。它由帧图片、puppet_mask掩码和文本标注三部分组成。标准目录结构jhmdb_sentences/ ├── Rename_Images/ (帧图片) │ └── */ (动作类别目录) ├── puppet_mask/ (掩码标注) │ └── */ (动作类别目录) └── jhmdb_annotation.txt (文本标注,928 行)预处理:三个采样帧与元数据由于评估时只从每个视频中均匀采样 3 帧,为了保证结果可复现,仓库内置了采样元数据datasets/jhmdb_sentences/jhmdb_sentences_samples_metadata.json,评估时会自动加载。如果你希望强制重新采样,可以在configs/jhmdb_sentences.yaml中把generate_new_samples_metadata改为true并调整seed。JHMDB 的 COCO 格式 ground truth 同样会在首次评估时自动生成(由datasets/jhmdb_sentences/create_gt_in_coco_format.py完成),无需手动操作。Refer-YouTube-VOS 数据集:需要注册的竞赛数据集 这是三个数据集中获取门槛最高的一个:需要到 CodaLab 竞赛页面免费注册后才能下载,且只有训练集公开标注,验证集标注不公开,评估必须上传预测结果到竞赛服务器。标准目录结构refer_youtube_vos/ ├── train/ │ ├── JPEGImages/ (帧图片) │ │ └── */ (视频文件夹) │ └── Annotations/ (PNG 掩码标注,仅训练集有) ├── valid/ │ └── JPEGImages/ (验证集帧图片) └── meta_expressions/ ├── train/meta_expressions.json └── valid/meta_expressions.json预处理:元数据缓存文件Refer-YouTube-VOS 首次加载时会生成样本元数据文件,训练集按窗口大小命名,如datasets/refer_youtube_vos/train_samples_metadata_win_size_12.json、train_samples_metadata_win_size_8.json。生成过程使用多进程并行,耗时较长但只需跑一次。⚠️ 验证集(valid)共 202 个视频,代码会读取meta_expressions/test/meta_expressions.json来过滤掉混在验证表达式中的测试视频,所以下载时请把 test 的表达式文件也一并准备好,否则过滤逻辑会报错。配置文件:数据准备的最后一公里 ⚙️目录组织完成后,还需要在对应 yaml 里确认两个关键项:数据集路径:代码默认从仓库根目录找./a2d_sentences等目录,如果你的数据放在别处,需要同步修改数据集类中的dataset_path参数。COCO GT 路径:评估用的 JSON 路径在配置里指定,例如configs/a2d_sentences.yaml中的dataset_coco_gt_format_path指向./datasets/a2d_sentences/a2d_sentences_test_annotations_in_coco_format.json,确保该路径与实际生成的文件一致。运行入口是main.py,例如评估 A2D 的命令形如:python main.py -rm eval -c configs/a2d_sentences.yaml -ws 8 -bs 3 -ckpt 你的权重路径 -ng 1数据准备自检清单 ✅用这份清单快速确认是否就绪:三个数据集目录名与代码读取路径完全一致a2d_sentences/Release/clips320H内视频齐全,videoset.csv恰好 3782 行a2d_annotation.txt恰好 6655 行,jhmdb_annotation.txt恰好 928 行Refer-YouTube-VOS 的 train(3471 视频)与 valid(202 视频)数量匹配meta_expressions下 train、valid、test 三个子目录的 JSON 均已就位已安装 h5py、pycocotools、pandas 等依赖(COCO 转换必需)首次评估时观察日志,确认 COCO GT 自动生成成功常见问题 FAQ Q: 评估时提示 videoset.csv 行数不对?A: 下载不完整或混入了多余文件,重新核对 A2D-Sentences 的Release/videoset.csv。Q: 目录名是 CLIPS320 还是 clips320H?A: 代码读取的是Release/clips320H(见a2d_sentences_dataset.py),请以下载后实际解压的目录为准并改名为代码期望的名字。Q: Refer-YouTube-VOS 验证集怎么评估?A: 验证集无公开标注,MTTR 会生成预测掩码压缩包(位于runs/[时间戳]/validation_outputs/下),需上传到竞赛服务器获得 JF 分数。Q: 只想快速跑通,有没有最小数据组合?A: 可以只准备 A2D-Sentences 完成训练 评估全流程;JHMDB 与 Refer-YouTube-VOS 按需补充即可。数据准备是MTTR实验成功的一半。按本指南把三大数据集下载、组织与预处理一次搞定后,接下来就是愉快地训练和评估了。祝你的指代视频目标分割实验顺利出成果!【免费下载链接】MTTR项目地址: https://gitcode.com/gh_mirrors/mt/MTTR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻