MBARI-org/yolo11x-uavs-detectv3
UAVS model trained on all verified object classes, collapsed to only one class: - object.
Classes collapsed to object class:
Batray Bird Boat CementShip Egregia Fish Jelly Kayak Kelp Mola MooringBuoy Otter Person Pinniped SecciDisc Shark Surfboard Velellavelella Velellavelellaraft Whale
Acts as object detector to feed detection stage of a pipeline
8.3.204 ๐ Python-3.12.11 torch-2.8.0+cu126 CUDA:0 (NVIDIA A100-SXM4-80GB, 81222MiB)
engine/trainer: agnosticnms=False, amp=True, augment=False, autoaugment=randaugment, batch=16, bgr=0.0, box=7.5, cache=False, cfg=None, classes=None, closemosaic=10, cls=0.5, compile=False, conf=None, copypaste=0.0, copypastemode=flip, coslr=False, cutmix=0.0, data=/content/datasets/data.yaml, degrees=0.0, deterministic=True, device=None, dfl=1.5, dnn=False, dropout=0.0, dynamic=False, embed=None, epochs=50, erasing=0.4, existok=False, fliplr=0.5, flipud=0.0, format=torchscript, fraction=1.0, freeze=None, half=False, hsvh=0.015, hsvs=0.7, hsvv=0.4, imgsz=640, int8=False, iou=0.7, keras=False, kobj=1.0, linewidth=None, lr0=0.01, lrf=0.01, maskratio=4, maxdet=300, mixup=0.0, mode=train, model=yolo11x.pt, momentum=0.937, mosaic=1.0, multiscale=False, name=train, nbs=64, nms=False, opset=None, optimize=False, optimizer=auto, overlapmask=True, patience=5, perspective=0.0, plots=True, pose=12.0, pretrained=True, profile=False, project=None, rect=False, resume=False, retinamasks=False, save=True, saveconf=False, savecrop=False, savedir=/content/runs/detect/train, saveframes=False, savejson=False, saveperiod=-1, savetxt=False, scale=0.5, seed=0, shear=0.0, show=False, showboxes=True, showconf=True, showlabels=True, simplify=True, singlecls=False, source=None, split=val, streambuffer=False, task=detect, time=None, tracker=botsort.yaml, translate=0.1, val=True, verbose=True, vidstride=1, visualize=False, warmupbiaslr=0.1, warmupepochs=3.0, warmupmomentum=0.8, weight_decay=0.0005, workers=8, workspace=None
YOLO11x summary (fused): 190 layers, 56,828,179 parameters, 0 gradients, 194.4 GFLOPs
50 epochs
Class all
Total original images in dataset: 2935
Total original localizations in dataset: 33482
Images, localizations transformed to 640 pixels, 50% overlap
Transformed images: 92703
Transformed localizations: 175178
Train/val/test split 85%/10%/5%
Train 78728 images
Validation: Images 9387 Instances 17744
Test 4588 images
Val results:
P 0.635
R 0.53
mAP50 0.588
mAP50-95 0.408
Speed: 0.1ms preprocess, 3.5ms inference, 0.0ms loss, 0.8ms postprocess per image





