使用 Ultralytics YOLO 进行姿态估计#
姿态估计是一项用于识别图像中特定点位置的任务,这些点通常称为关键点。关键点可以表示对象的不同部位,例如关节、地标或其他显著特征。关键点的位置通常表示为一组二维 [x, y] 坐标,可选择性地附带可见性标志 [x, y, visible]。
姿态估计模型的输出是一组表示图像中对象关键点的点,通常还会包含每个点的置信度分数。当你需要识别场景中对象的特定部位,以及这些部位之间的相对位置时,姿态估计是一个不错的选择。
Watch: How to Run Real-Time Pose Estimation with Ultralytics YOLO26 | Tracking & Keypoints Extraction 🕺
YOLO26 姿态模型使用 -pose 后缀,即 yolo26n-pose.pt。这些模型在 COCO 关键点数据集上训练,适用于各种姿态估计任务。
默认的 YOLO26 姿态模型包含 17 个关键点,每个关键点代表人体的不同部位。下面是每个索引与相应身体关节的映射:
- 鼻子
- 左眼
- 右眼
- 左耳
- 右耳
- 左肩
- 右肩
- 左肘
- 右肘
- 左腕
- 右腕
- 左髋
- 右髋
- 左膝
- 右膝
- 左踝
- 右踝
模型#
这里展示了 Ultralytics YOLO26 预训练姿态模型。检测、分割和姿态模型在 COCO 数据集上进行预训练,语义模型在 Cityscapes 上进行预训练,分类模型则在 ImageNet 数据集上进行预训练。
首次使用时,模型 会自动从最新的 Ultralytics 发布版本 下载。
| 模型 | 尺寸 (像素) | mAP姿态 50-95(e2e) | mAP姿态 50(e2e) | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (毫秒) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n-pose | 640 | 57.2 | 83.3 | 40.3 ± 0.5 | 1.8 ± 0.0 | 2.9 | 7.6 |
| YOLO26s-pose | 640 | 63.0 | 86.6 | 85.3 ± 0.9 | 2.7 ± 0.0 | 10.4 | 24.1 |
| YOLO26m-pose | 640 | 68.8 | 89.6 | 218.0 ± 1.5 | 5.0 ± 0.1 | 21.5 | 73.3 |
| YOLO26l-pose | 640 | 70.4 | 90.5 | 275.4 ± 2.4 | 6.5 ± 0.1 | 25.9 | 91.7 |
| YOLO26x-pose | 640 | 71.6 | 91.6 | 565.4 ± 3.0 | 12.2 ± 0.2 | 57.6 | 202.3 |
- mAPval 值针对 COCO Keypoints val2017 数据集上的单模型单尺度结果。
使用yolo val pose data=coco-pose.yaml device=0 nms=False重现 - 速度是在使用 Amazon EC2 P4d 实例处理 COCO val 图像时的平均值。
通过yolo val pose data=coco-pose.yaml batch=1 device=0|cpu nms=False复现 - Params 和 FLOPs 数值适用于在进行卷积与批归一化折叠以及移除未使用的检测分支之后的融合模型。预训练检查点保留完整的训练架构,可能会显示更高的数值。
查看未发布的 YOLO27 预览版以获取初步的 COCO 关键点结果。
训练#
在 COCO8-pose 数据集上训练 YOLO26-pose 模型。COCO8-pose 数据集是一个小型样本数据集,非常适合测试和调试你的姿态估计模型。
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-pose.yaml") # build a new model from YAML
model = YOLO("yolo26n-pose.pt") # load a pretrained model (recommended for training)
model = YOLO("yolo26n-pose.yaml").load("yolo26n-pose.pt") # build from YAML and transfer weights
# Train the model
results = model.train(data="coco8-pose.yaml", epochs=100, imgsz=640)在 Train 页面中查看完整的 train 模式详细信息。姿态模型也可以通过 Ultralytics Platform 云训练进行训练。
数据集格式#
YOLO 姿态数据集格式的详细信息可以在 Dataset Guide 中找到。要将现有的 COCO keypoints JSON 数据集转换为 YOLO 格式,请使用内置的 convert_coco 函数配合 use_keypoints=True,如 COCO to YOLO guide 中所述。Ultralytics Platform annotation 还支持带有内置骨骼模板的姿态标签,适用于人体、手部、面部以及自定义关键点布局。
对于自定义姿态估计任务,你还可以探索专用数据集,例如用于动物姿态估计的 Tiger-Pose、用于手部跟踪的 Hand Keypoints,或用于犬类姿态分析的 Dog-Pose。
验证#
在 COCO8-pose 数据集上验证经过训练的 YOLO26n-pose 模型的准确率。无需提供参数,因为 model 会保留训练时的 data 和参数作为模型属性。
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-pose.pt") # load an official model
model = YOLO("path/to/best.pt") # load a custom model
# Validate the model
metrics = model.val() # no arguments needed, dataset and settings remembered
metrics.box.map # map50-95
metrics.box.map50 # map50
metrics.box.map75 # map75
metrics.box.maps # a list containing mAP50-95 for each category
metrics.box.image_metrics # per-image metrics dictionary for box with precision, recall, F1, TP, FP, and FN
metrics.pose.map # map50-95(P)
metrics.pose.map50 # map50(P)
metrics.pose.map75 # map75(P)
metrics.pose.maps # a list containing mAP50-95(P) for each category
metrics.pose.image_metrics # per-image metrics dictionary for pose with precision, recall, F1, TP, FP, and FNPredict#
使用经过训练的 YOLO26n-pose 模型对图像运行预测。predict 模式支持你对图像、视频或实时流执行推理。
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-pose.pt") # load an official model
model = YOLO("path/to/best.pt") # load a custom model
# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg") # predict on an image
# Access the results
for result in results:
xy = result.keypoints.xy # x and y coordinates
xyn = result.keypoints.xyn # normalized
kpts = result.keypoints.data # x, y, visibility (if available)请在预测页面查看完整的 predict 模式详情。
结果输出#
姿态估计会为每张图像返回一个 Results 对象。主要的预测字段包括用于姿态
坐标的 result.keypoints,以及用于表示这些关键点所属检测实例的 result.boxes。
| 属性 | 类型 | 形状 | 描述 |
|---|---|---|---|
result.keypoints | Keypoints | (N) | 关键点。 |
result.keypoints.data | torch.float32 |