Ultralytics YOLO27:

데이터셋 개요#

Ultralytics는 객체 탐지, 인스턴스 세그멘테이션, 시맨틱 세그멘테이션, 깊이 추정, 분류, 포즈 추정 및 방향성 바운딩 박스(OBB)와 같은 컴퓨터 비전 작업을 지원하기 위해 다양한 데이터셋을 제공합니다. 아래에는 주요 Ultralytics 데이터셋 목록과 각 컴퓨터 비전 작업 및 해당 데이터셋에 대한 요약이 나와 있습니다. 트랙 모드는 트래커별 학습 없이 탐지, 세그멘테이션, 포즈 및 OBB 모델 위에서 실행됩니다. 자세한 내용은 트래킹 데이터셋을 참조하십시오.



Watch: Ultralytics Datasets Overview

Object Detection#

바운딩 박스 객체 탐지는 이미지의 각 객체 주위에 바운딩 박스를 그려 객체를 탐지하고 위치를 식별하는 컴퓨터 비전 기법입니다.

  • African-wildlife: 물소, 코끼리, 코뿔소, 얼룩말을 비롯한 아프리카 야생동물 이미지가 포함된 데이터셋입니다.
  • Argoverse: 풍부한 어노테이션이 포함된 도시 환경의 3D 트래킹 및 모션 예측 데이터셋입니다.
  • Brain-tumor: 종양의 존재 여부, 위치 및 특성에 대한 세부 정보와 MRI 또는 CT 스캔 이미지가 포함된 뇌종양 탐지용 데이터셋입니다.
  • COCO: 문맥 속 일반 객체(COCO)는 80개 객체 카테고리를 포함하는 대규모 객체 탐지, 세그멘테이션 및 캡셔닝 데이터셋입니다.
  • COCO8: COCO train2017의 처음 8개 이미지 중 더 작은 서브셋으로, 4개는 학습용, 4개는 검증용이며 빠른 테스트에 적합합니다.
  • COCO8-Grayscale: RGB를 그레이스케일로 변환하여 생성한 COCO8의 그레이스케일 버전으로, 단일 채널 모델 평가에 유용합니다.
  • COCO8-Multispectral: RGB 파장을 보간하여 생성한 COCO8의 10채널 멀티스펙트럴 버전으로, 스펙트럼을 고려한 모델 평가에 유용합니다.
  • COCO12-Formats: 이미지 로딩 파이프라인을 검증하기 위한 12가지 지원 이미지 포맷(AVIF, BMP, DNG, HEIC, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WebP)을 포함하는 12개 이미지 테스트 데이터셋입니다.
  • COCO128: COCO train2017의 첫 128개 이미지로 구성된 소규모 서브셋으로, 테스트에 적합합니다.
  • Construction-PPE: 헬멧, 조끼, 장갑, 부츠, 보안경과 같은 주요 안전 장비와 장비 누락 라벨이 어노테이션된 건설 현장 이미지 데이터셋으로, 규정 준수 및 작업자 보호를 위한 AI 모델 개발을 지원합니다.
  • Global Wheat 2020: Global Wheat Challenge 2020을 위한 밀 이삭 이미지 데이터셋입니다.
  • HomeObjects-3K: 12가지 일반 가정용 물품이 포함된 어노테이션된 실내 장면 데이터셋으로, 스마트 홈 시스템, 로보틱스 및 증강 현실용 컴퓨터 비전 모델 개발과 테스트에 적합합니다.
  • KITTI: 스테레오, LiDAR 및 GPS/IMU 입력을 특징으로 하며 다양한 도로 장면에서의 2D 객체 검출에 사용되는 잘 알려진 자율주행 데이터셋입니다.
  • LVIS: 1,203개 객체 카테고리를 포함하는 대규모 객체 탐지, 세그멘테이션 및 캡셔닝 데이터셋입니다.
  • Medical-pills: 의약품 품질 관리, 분류 및 산업 표준 준수 확인과 같은 작업을 지원하도록 설계된, 라벨이 지정된 의약품 알약 이미지 데이터셋입니다.
  • Objects365: 365개 객체 카테고리와 600K개 이상의 어노테이션된 이미지를 포함하는 고품질 대규모 객체 탐지 데이터셋입니다.
  • OpenImagesV7: Google이 제공하는 종합 데이터셋으로, 1.7M개의 학습 이미지와 42k개의 검증 이미지가 포함되어 있습니다.
  • RF100: 종합적인 모델 평가를 위해 7개 이미지 도메인에 걸친 100개 데이터셋으로 구성된 다양한 객체 탐지 벤치마크입니다.
  • Signature: 어노테이션된 서명이 포함된 다양한 문서 이미지 데이터셋으로, 문서 검증 및 사기 탐지 연구를 지원합니다.
  • SKU-110K: 11K개 이상의 이미지와 170만 개의 바운딩 박스가 포함된 소매 환경의 밀집 객체 탐지 데이터셋입니다.
  • TT100K: 221개 표지판 카테고리에 걸쳐 16,817개의 거리 뷰 이미지를 포함하는 칭화-텐센트 100K 교통 표지판 데이터셋입니다.
  • VisDrone: 드론으로 촬영한 이미지에서 얻은 객체 탐지 및 다중 객체 트래킹 데이터셋으로, 10K개 이상의 이미지와 비디오 시퀀스가 포함되어 있습니다.
  • VOC: 20개 객체 클래스와 11K개 이상의 이미지가 포함된 객체 탐지 및 세그멘테이션용 Pascal 시각 객체 클래스(VOC) 데이터셋입니다.
  • xView: 60개 객체 카테고리와 100만 개 이상의 어노테이션된 객체가 포함된 항공·위성 이미지 객체 탐지용 데이터셋입니다.

인스턴스 세그멘테이션#

인스턴스 세그멘테이션은 이미지에서 객체를 픽셀 수준으로 식별하고 위치를 파악하는 컴퓨터 비전 기법입니다. 각 픽셀을 분류하기만 하는 시맨틱 세그멘테이션과 달리, 인스턴스 세그멘테이션은 동일한 클래스에 속하는 서로 다른 인스턴스를 구분합니다.

  • Carparts-seg: 차량 부품 식별을 위해 특수 제작된 데이터셋으로, 설계, 제조 및 연구 요구 사항을 지원합니다. 객체 탐지와 세그멘테이션 작업 모두에 사용할 수 있습니다.
  • COCO: 객체 탐지, 세그멘테이션 및 캡셔닝 작업을 위해 설계된 대규모 데이터셋으로, 200K개 이상의 라벨링된 이미지가 포함되어 있습니다.
  • COCO8-seg: 세그멘테이션 어노테이션이 포함된 COCO 이미지 8개 서브셋으로 구성된 인스턴스 세그멘테이션 작업용 소규모 데이터셋입니다.
  • COCO128-seg: 세그멘테이션 어노테이션이 포함된 COCO 이미지 128개 서브셋으로 구성된 인스턴스 세그멘테이션 작업용 소규모 데이터셋입니다.
  • Crack-seg: 도로와 벽의 균열 탐지를 위해 특별히 제작된 데이터셋으로, 객체 탐지와 세그멘테이션 작업 모두에 적용할 수 있습니다.
  • Package-seg: 창고 또는 산업 환경의 패키지 식별에 맞춰 설계된 데이터셋으로, 객체 탐지와 세그멘테이션 애플리케이션 모두에 적합합니다.

시맨틱 세그멘테이션#

시맨틱 세그멘테이션은 이미지의 모든 픽셀에 클래스 라벨을 할당하여 자율주행, 장면 파싱 및 토지 피복 매핑과 같은 애플리케이션을 위한 조밀한 장면 맵을 생성합니다.

  • Cityscapes: 19개 학습 클래스가 포함된 도시 거리 장면 시맨틱 세그멘테이션 데이터셋입니다.
  • Cityscapes8: 빠른 시맨틱 세그멘테이션 파이프라인 점검을 위한 Cityscapes 이미지 8개 규모의 소형 서브셋입니다.
  • ADE20K: 150개 시맨틱 클래스가 포함된 장면 파싱 데이터셋입니다.

깊이 추정#

단안 깊이 추정은 단일 RGB 이미지에서 픽셀별 깊이 맵을 미터 단위로 예측하며, 3D 장면 재구성, 로봇 내비게이션 및 AR/VR 애플리케이션을 지원합니다.

  • Depth8: 빠른 파이프라인 점검을 위한 SUN RGB-D 이미지 8개 규모의 소형 서브셋입니다.
  • ARKitScenes: Apple ARKit LiDAR로 캡처한 실제 실내 RGB-D로, 가장 큰 실제 학습 소스입니다.
  • SUN RGB-D: 네 가지 서로 다른 RGB-D 센서로 캡처한 실제 실내 장면입니다.
  • DIODE: 측량 등급 레이저 스캐너에서 얻은 조밀한 실내 및 실외 깊이입니다.
  • Hypersim: 완벽한 픽셀당 깊이를 가진 포토리얼리스틱 합성 실내 장면입니다.
  • TartanAir: 최대 ~80m의 조밀한 깊이를 가진 합성 AirSim 환경입니다.
  • Virtual KITTI 2: 조밀한 깊이를 가진 KITTI 주행 장면의 합성 재현입니다.
  • KITTI: Velodyne LiDAR 깊이가 포함된 실제 야외 자율주행 장면이며, KITTI Eigen 벤치마크이기도 합니다.
  • ImageNet (pseudo-labeled): 증류를 위한 Depth Anything 3사사 레이블이 포함된 ImageNet-1K 이미지입니다.
  • NYU Depth V2: Microsoft Kinect v1으로 캡처한 표준 실내 깊이 벤치마크입니다.
  • ETH3D: 고정밀 실내 및 실외 레이저 스캐너 벤치마크입니다.
  • Make3D: 분포 외 실외 캠퍼스 벤치마크입니다.
  • iBims-1: 깊이 모서리 및 평면 표면을 위한 고품질 실내 벤치마크입니다.

분류#

이미지 분류는 시각적 콘텐츠를 기반으로 이미지를 하나 이상의 사전 정의된 클래스 또는 카테고리로 분류하는 컴퓨터 비전 작업입니다.

  • Caltech 101: 이미지 분류 작업을 위한 101개 객체 카테고리의 이미지가 포함된 데이터셋입니다.
  • Caltech 256: 256개 객체 카테고리와 더 까다로운 이미지가 포함된 Caltech 101의 확장 버전입니다.
  • CIFAR-10: 10개 클래스의 32x32 컬러 이미지 60K개로 구성되며, 클래스당 6K개의 이미지가 포함된 데이터셋입니다.
  • CIFAR-100: 100개 객체 카테고리와 클래스당 600개 이미지가 포함된 CIFAR-10의 확장 버전입니다.
  • Fashion-MNIST: 이미지 분류 작업을 위한 10개 패션 카테고리의 그레이스케일 이미지 70,000개로 구성된 데이터셋입니다.
  • ImageNet: 1,400만 개 이상의 이미지와 20,000개 카테고리가 포함된 대규모 객체 탐지 및 이미지 분류 데이터셋입니다.
  • ImageNet-10: 더 빠른 실험과 테스트를 위한 ImageNet의 10개 카테고리 소규모 서브셋입니다.
  • Imagenette: 빠른 학습과 테스트를 위해 쉽게 구별할 수 있는 10개 클래스로 구성된 ImageNet의 소규모 서브셋입니다.
  • Imagewoof: 이미지 분류 작업을 위해 10개 견종 카테고리로 구성된 ImageNet의 더 까다로운 서브셋입니다.
  • MNIST: 이미지 분류 작업을 위한 손글씨 숫자 그레이스케일 이미지 70,000개 데이터셋입니다.
  • MNIST160: MNIST train 및 test 분할에서 각 숫자(0-9)의 처음 8개 이미지로 구성됩니다. 데이터셋에는 총 160개의 이미지가 포함되어 있습니다.

포즈 추정#

포즈 추정은 카메라 또는 월드 좌표계에 대한 객체의 포즈를 파악하는 데 사용되는 기법입니다. 여기에는 특히 사람이나 동물과 같은 객체의 주요 지점 또는 관절을 식별하는 작업이 포함됩니다.

  • COCO: 포즈 추정 작업을 위해 설계된 사람 포즈 어노테이션이 포함된 대규모 데이터셋입니다.
  • COCO8-pose: 사람 포즈 어노테이션이 포함된 COCO 이미지 8개 서브셋으로 구성된 포즈 추정 작업용 소규모 데이터셋입니다.
  • Dog-pose: 개에 초점을 맞춘 약 8,500개의 이미지로 구성되며, 개 한 마리당 24개의 키포인트가 어노테이션된 포즈 추정 작업용 종합 데이터셋입니다.
  • Hand-Keypoints: 사람 손에 초점을 맞춘 26,000개 이상의 이미지로 구성되며, 손 하나당 21개의 키포인트가 어노테이션된 포즈 추정 작업용 간결한 데이터셋입니다.