简介:这份资源是面向人工智能与计算机视觉方向研究者、学生及算法工程师的潜艇卫星图目标检测数据集,可用于训练和验证水下目标识别模型,服务于海洋监控、国防安全与环境监测等场景。压缩包共2001个文件,包含1000张1024×1024像素的jpg卫星图像、1000个xml标注文件以及1个info.txt说明文档,整体约345.83MB;标注以边界框形式记录潜艇位置与类别,可直接对接YOLO、Faster R-CNN等主流检测框架。info.txt提供数据集总体说明,annotations存放每张图的坐标与类别信息,images则保存原始卫星图像,目录划分清晰,便于按模块解析与加载。目前已有1686人学习下载,适合需要快速搭建目标检测实验、验证算法精度与实时性的读者参考使用。
1. 潜艇卫星图目标检测数据集:从零训练一个能用的检测器
潜艇卫星图目标检测数据集,解决的是遥感场景下小目标、低对比度、复杂海况的检测问题。卫星图里的潜艇目标通常只有几十个像素,背景是海面杂波、云层阴影和港口设施,跟 COCO 里那些大目标完全不是一个难度。这个方向适合三类人:做遥感目标检测的研究生、需要海上态势感知的工程团队、以及想拿一个真实小目标数据集练手的算法工程师。数据集本身通常包含光学卫星或 SAR 影像,标注格式以水平框或旋转框为主,类别一般只有“潜艇”或“舰船”一两类。难点不在模型结构,而在数据预处理、小目标增强和评估指标的选择。下面按“数据集怎么读 → 模型怎么选 → 训练怎么调 → 坑在哪 → 怎么验证”的顺序拆开讲。
2. 潜艇卫星图数据集的读取与格式转换:从原始标注到 YOLO 可训练
2.1 先搞清楚你的数据集是水平框还是旋转框
拿到一个潜艇卫星图数据集,第一件事不是写模型,而是确认标注类型。常见的有三种:PASCAL VOC 的 XML 水平框、COCO 的 JSON 水平框、DOTA 格式的旋转框。潜艇在卫星图里往往有明确朝向,水平框会引入大量背景像素,旋转框更合适。但旋转框训练需要 mmrotate 或 YOLOv8-OBB 这类框架,不是所有团队都熟悉。我的建议是:如果目标长宽比超过 3:1,优先考虑旋转框;如果只是做粗定位,水平框也能跑出可用结果。
判断方法很简单,打开标注文件看坐标数量。VOC 的 bndbox 有四个值,DOTA 的标注有八个值(四个角点)。下面是一个快速统计脚本:
import os import xml.etree.ElementTree as ET # 统计VOC格式标注中目标的长宽比分布 ratios = [] for xml_file in os.listdir('annotations'): if not xml_file.endswith('.xml'): continue tree = ET.parse(os.path.join('annotations', xml_file)) for obj in tree.findall('object'): bbox = obj.find('bndbox') w = float(bbox.find('xmax').text) - float(bbox.find('xmin').text) h = float(bbox.find('ymax').text) - float(bbox.find('ymin').text) if h > 0: ratios.append(w / h) import numpy as np ratios = np.array(ratios) print(f"目标数量: {len(ratios)}") print(f"长宽比中位数: {np.median(ratios):.2f}") print(f"长宽比>3的比例: {(ratios > 3).mean():.2%}")这段代码遍历所有 XML 文件,提取每个目标框的宽高,计算长宽比。如果中位数超过 3,说明目标细长,旋转框更合适。参数上,annotations目录换成你的实际路径即可。注意有些数据集用xmin/ymin/xmax/ymax,有些用xmin/ymin/width/height,读之前先看一个文件确认字段名。
2.2 转成 YOLO 格式:四个边界坑
YOLO 训练需要每张图对应一个 txt,每行是class_id x_center y_center width height,全部归一化到 0-1。转换脚本网上一搜一大把,但潜艇卫星图有几个特殊坑:
第一,图像尺寸不一致。卫星图可能是 1024×1024、512×512 甚至 2048×2048 混在一起。归一化时必须用每张图自己的宽高,不能用一个全局尺寸。
第二,有些标注框超出图像边界。卫星图拼接时边缘目标会被裁切,标注可能保留原始坐标导致 xmax 大于图像宽度。转换前要 clamp 到 [0, width]。
第三,类别名映射。如果数据集里写的是 “submarine” 和 “warship”,你要决定是合并成一类还是保留两类。潜艇检测通常只关心潜艇,建议合并成 “submarine” 一类,减少类间混淆。
第四,空标注文件。有些图没有目标,YOLO 需要对应的空 txt 文件,否则训练时会报错。转换时记得为每张图都生成 txt,哪怕内容是空的。
import os import xml.etree.ElementTree as ET from PIL import Image def voc_to_yolo(xml_dir, img_dir, out_dir, class_map): os.makedirs(out_dir, exist_ok=True) for xml_file in os.listdir(xml_dir): if not xml_file.endswith('.xml'): continue tree = ET.parse(os.path.join(xml_dir, xml_file)) root = tree.getroot() # 用对应的图像文件获取真实宽高 img_name = os.path.splitext(xml_file)[0] + '.jpg' img_path = os.path.join(img_dir, img_name) if not os.path.exists(img_path): continue with Image.open(img_path) as im: W, H = im.size lines = [] for obj in root.findall('object'): name = obj.find('name').text if name not in class_map: continue cls_id = class_map[name] bbox = obj.find('bndbox') xmin = max(0, float(bbox.find('xmin').text)) ymin = max(0, float(bbox.find('ymin').text)) xmax = min(W, float(bbox.find('xmax').text)) ymax = min(H, float(bbox.find('ymax').text)) # 过滤掉无效框 if xmax <= xmin or ymax <= ymin: continue xc = (xmin + xmax) / 2 / W yc = (ymin + ymax) / 2 / H w = (xmax - xmin) / W h = (ymax - ymin) / H lines.append(f"{cls_id} {xc:.6f} {yc:.6f} {w:.6f} {h:.6f}") out_path = os.path.join(out_dir, os.path.splitext(xml_file)[0] + '.txt') with open(out_path, 'w') as f: f.write('\n'.join(lines)) voc_to_yolo('annotations', 'images', 'labels', {'submarine': 0})逻辑说明:先读 XML,再用 PIL 打开对应图像拿真实宽高,然后对每个目标框做边界裁剪和归一化。class_map控制类别映射,只保留需要的类别。参数上,xml_dir、img_dir、out_dir按实际路径改。注意xmax和ymax要 clamp 到图像宽高,否则归一化后坐标会大于 1,YOLO 训练时直接报错。
2.3 数据集划分:别用随机划分
遥感图像有个特点:同一区域的多张图高度相似。如果随机划分训练集和验证集,验证集里可能有跟训练集几乎一样的图,指标虚高。正确做法是按区域或按时间划分。如果数据集本身按区域组织,直接按区域分;如果没有,用图像的地理坐标做聚类,同一簇的图分到同一侧。没有坐标信息时,至少按文件名前缀分组,别让同一批次的图跨集。
import os import random from sklearn.cluster import KMeans import numpy as np # 假设文件名里包含经纬度或区域编号,这里用文件名哈希模拟分组 files = [f for f in os.listdir('images') if f.endswith('.jpg')] # 按前缀分组,前缀相同的分到同一侧 groups = {} for f in files: prefix = f.split('_')[0] groups.setdefault(prefix, []).append(f) group_keys = list(groups.keys()) random.shuffle(group_keys) split = int(len(group_keys) * 0.8) train_groups = group_keys[:split] val_groups = group_keys[split:] with open('train.txt', 'w') as f: for g in train_groups: for img in groups[g]: f.write(f"images/{img}\n") with open('val.txt', 'w') as f: for g in val_groups: for img in groups[g]: f.write(f"images/{img}\n")这段代码按文件名前缀分组,保证同一组的图不会同时出现在训练和验证集。参数上,0.8是训练集比例,按需调整。如果你的数据集有地理坐标,把prefix换成坐标聚类结果更好。
3. 模型选型与训练参数:YOLOv8 还是旋转框检测器
3.1 水平框场景:YOLOv8 够用,但要注意输入分辨率
潜艇卫星图目标小,YOLOv8 默认 640 输入下,一个 30 像素的目标缩到 640 后只剩不到 20 像素,特征图上的响应很弱。常见做法是把输入提到 1024 或 1280,但显存占用会翻倍。我的经验是:先试 1024,如果 mAP 不够再上 1280,同时把 batch size 降到 4 或 2。YOLOv8 的imgsz参数直接控制输入尺寸,训练命令如下:
yolo detect train \ data=submarine.yaml \ model=yolov8s.pt \ imgsz=1024 \ epochs=200 \ batch=4 \ patience=30 \ lr0=0.01 \ lrf=0.01 \ mosaic=0.5 \ scale=0.3 \ degrees=0.0 \ translate=0.1 \ fliplr=0.5 \ flipud=0.5 \ device=0参数说明:imgsz=1024是输入分辨率,小目标场景别低于 1024。batch=4是显存不够时的妥协,显存够可以上 8。mosaic=0.5控制 mosaic 增强概率,小目标场景建议降到 0.5 以下,因为 mosaic 会把四张图拼一起,目标更小。scale=0.3是缩放增强幅度,别太大,否则小目标直接消失。flipud=0.5是上下翻转,卫星图没有方向性,上下翻转合理。degrees=0.0关闭旋转,水平框场景旋转会引入无效框。
3.2 旋转框场景:mmrotate 或 YOLOv8-OBB
如果目标长宽比大,水平框漏检严重,就得上旋转框。mmrotate 是 OpenMMLab 的旋转框检测工具箱,支持 DOTA 格式。YOLOv8-OBB 是 Ultralytics 的旋转框版本,上手更快。两者选型看团队熟悉度:mmrotate 配置灵活但学习曲线陡,YOLOv8-OBB 开箱即用但自定义受限。
mmrotate 训练配置的核心参数在configs/_base_/datasets/dota.py里,主要改img_scale、keep_ratio和classes。潜艇数据类别少,把num_classes改成 1 或 2。训练命令:
python tools/train.py \ configs/rotated_retinanet/rotated-retinanet-rbox-le90_r50_fpn_1x_dota.py \ --work-dir work_dirs/submarine \ --cfg-options data.train.dataset.classes=('submarine',) \ data.val.dataset.classes=('submarine',) \ model.bbox_head.num_classes=1参数说明:--cfg-options直接覆盖配置里的类别数和类别名。work-dir是输出目录。注意 mmrotate 的 DOTA 格式标注需要images和labelTxt两个目录,labelTxt里每行是x1 y1 x2 y2 x3 y3 x4 y4 class_name difficult。
3.3 小目标增强:三个真正有用的技巧
第一个,切图训练。把 1024×1024 的图切成 512×512 带重叠,目标相对变大。推理时再拼回去。切图重叠率设 0.2,太小会漏掉边缘目标,太大浪费算力。
第二个,复制粘贴增强。把训练集里的潜艇目标抠出来,随机贴到其他海面背景上。这个对小目标提升明显,但要注意粘贴位置别太离谱,别贴到陆地上。
第三个,负样本挖掘。海面杂波、云层阴影、小岛都容易被误检。把这些图作为负样本加入训练,能显著降低误报。负样本不需要标注,YOLO 里放空 txt 即可。
4. 潜艇卫星图检测的避坑与排查:五个血泪教训
4.1 现象:训练 loss 正常下降,但 mAP 一直是 0
原因:标注格式不对。YOLO 要求归一化坐标,如果转换时忘了除以宽高,坐标全是几百的整数,模型学不到东西。或者类别 id 从 1 开始,YOLO 要求从 0 开始。
解决:打开一个 label txt 文件,确认所有值都在 0-1 之间。如果不在,检查转换脚本的归一化步骤。类别 id 用class_map显式映射,别依赖标注文件里的原始 id。
4.2 现象:验证集 mAP 很高,但实际推理漏检严重
原因:训练集和验证集同分布,但实际场景的卫星图分辨率、光照、海况跟数据集不一样。或者验证集划分时同一区域的图跨了集,指标虚高。
解决:按区域重新划分验证集,确保验证集区域跟训练集不重叠。另外,实际推理时把输入分辨率提到跟训练一致,别用默认 640。
4.3 现象:模型把海浪杂波检测成潜艇
原因:负样本不足。训练集里全是带潜艇的图,模型没见过纯海面,把高频纹理当成目标特征。
解决:加入负样本图,空 txt 标注。负样本比例控制在 10%-20%,太多会拉低召回。另外,推理时提高置信度阈值,从 0.25 提到 0.4 试试。
4.4 现象:旋转框训练时 loss 震荡不收敛
原因:旋转框的角度定义不一致。mmrotate 里角度有 le90、le135、oc 等多种定义,数据标注和配置不匹配时,角度回归会乱。
解决:确认标注文件的角度定义跟配置一致。DOTA 格式默认是 le90,如果标注是 le135,需要在配置里改angle_version。另外,学习率别设太大,旋转框回归比水平框敏感,lr0从 0.01 降到 0.005 试试。
4.5 现象:推理速度慢,达不到实时
原因:输入分辨率太高,或者模型太大。1024 输入的 YOLOv8s 在单卡上大概 20-30 FPS,如果要求实时,得降分辨率或换更小的模型。
解决:先确认业务是否真的需要实时。卫星图检测通常是离线批处理,不需要实时。如果确实要实时,用 YOLOv8n 加 640 输入,但小目标漏检会变多,需要权衡。
5. 验证与调优:用混淆矩阵和 PR 曲线定位问题
训练完不是看一个 mAP 就完事。打开 YOLO 输出的混淆矩阵,看误检和漏检分别集中在哪。潜艇检测常见的是把“潜艇”和“舰船”搞混,如果数据集里这两类都有,混淆矩阵会直接告诉你。如果只有一类,看背景误检率,也就是有多少背景被误判成潜艇。
PR 曲线看的是不同置信度下的精确率和召回率。潜艇检测通常要求高召回,因为漏掉一个潜艇比误报一个严重。把置信度阈值调到召回率 0.9 以上,看精确率掉到多少。如果精确率低于 0.5,说明误报太多,得加负样本或提高模型容量。
from ultralytics import YOLO import matplotlib.pyplot as plt model = YOLO('runs/detect/train/weights/best.pt') metrics = model.val(data='submarine.yaml', imgsz=1024, conf=0.001, iou=0.5) # 打印各类别的AP for i, name in enumerate(metrics.names): print(f"{name}: AP50={metrics.box.ap50[i]:.3f}, AP={metrics.box.ap[i]:.3f}") # 绘制PR曲线 metrics.box.plot_pr_curve() plt.savefig('pr_curve.png')这段代码加载训练好的模型,在验证集上跑评估。conf=0.001是为了画完整的 PR 曲线,实际部署时用 0.25 或更高。metrics.box.ap50是 IoU=0.5 时的 AP,metrics.box.ap是 IoU=0.5:0.95 的平均 AP。潜艇检测主要看 AP50,因为定位精度要求没那么高。
调优方向按优先级排:先加数据,再加负样本,再调输入分辨率,最后才动模型结构。我见过太多人一上来就改网络,结果数据里一堆错标,改什么都没用。卫星图数据集的质量比模型重要得多,标注框有没有把潜艇完整框住、有没有漏标、类别有没有标错,这些检查一遍比调参一周都管用。
还有一个习惯:每次训练完把预测结果可视化几张,肉眼看看漏在哪、误检在哪。指标是黑匣子,图是真相。我一般会抽 20 张验证集图,用model.predict跑一遍,存下来对比。如果发现某个区域的图普遍漏检,大概率是那个区域的海况跟训练集差异大,得补数据。希望帮到你。
本文还有配套的精品资源,点击获取