Các Tác Vụ Thị Giác Máy Tính Được Hỗ Trợ Bởi Ultralytics YOLO26#
Ultralytics YOLO26 là một framework AI đa năng, hỗ trợ nhiều tác vụ thị giác máy tính. Framework này có thể được sử dụng để thực hiện phát hiện, phân đoạn, phân đoạn ngữ nghĩa, ước lượng độ sâu, phân loại, pose và ước lượng, cũng như OBB. Mỗi tác vụ có một mục tiêu và trường hợp sử dụng khác nhau, cho phép bạn giải quyết nhiều bài toán thị giác máy tính bằng một framework duy nhất.
Để biết thông tin về hỗ trợ YOLO27 trong kế hoạch, hãy xem bản xem trước YOLO27. YOLO27 sắp ra mắt và chưa khả dụng; hướng dẫn này sử dụng các model YOLO26 đã phát hành.
Watch: Explore Ultralytics YOLO26 Tasks: Object Detection, Segmentation, Depth Estimation, Classification, Pose Estimation, and OBB.
Detection#
Phát hiện đối tượng là tác vụ chính được hỗ trợ bởi YOLO26. Tác vụ này liên quan đến việc nhận dạng các đối tượng trong một hình ảnh hoặc khung hình video và vẽ các hộp giới hạn xung quanh các đối tượng đó. Các đối tượng được phát hiện sẽ được phân loại thành các danh mục khác nhau dựa trên các đặc điểm của chúng. YOLO26 có thể phát hiện nhiều đối tượng trong một hình ảnh hoặc khung hình video duy nhất với độ chính xác và tốc độ cao, làm cho YOLO26 trở nên lý tưởng cho các ứng dụng thời gian thực như hệ thống giám sát và xe tự hành.
Phân đoạn instance#
Phân đoạn đẩy việc phát hiện đối tượng đi xa hơn bằng cách tạo ra các mặt nạ cấp độ pixel cho từng đối tượng. Độ chính xác này hữu ích cho các ứng dụng như hình ảnh y tế, phân tích nông nghiệp và kiểm soát chất lượng sản xuất.
Semantic Segmentation#
Phân đoạn ngữ nghĩa gán một nhãn lớp cho mọi pixel trong một hình ảnh, tạo ra một bản đồ lớp dày đặc của toàn bộ cảnh. Không giống như phân đoạn thực thể, phân đoạn ngữ nghĩa không phân biệt giữa các đối tượng riêng lẻ cùng một lớp. Điều này làm cho phân đoạn ngữ nghĩa trở nên lý tưởng cho lái xe tự động, phân tích cảnh và lập bản đồ lớp phủ đất, nơi việc hiểu bố cục không gian toàn diện quan trọng hơn việc nhận dạng các đối tượng riêng lẻ.
Depth Estimation#
Ước tính độ sâu đơn mắt dự đoán bản đồ độ sâu theo từng pixel tính bằng mét từ một hình ảnh RGB đơn lẻ. Đầu ra là một bản đồ số thực dày đặc được căn chỉnh với hình ảnh đầu vào, làm cho bản đồ phù hợp cho việc tái tạo cảnh 3D, điều hướng robot và các ứng dụng AR/VR, nơi bố cục không gian phải được suy ra từ một camera đơn lẻ.
Classification#
Phân loại bao gồm việc phân loại toàn bộ hình ảnh dựa trên nội dung của chúng. Tác vụ này rất cần thiết cho các ứng dụng như phân loại sản phẩm trong thương mại điện tử, kiểm duyệt nội dung và giám sát động vật hoang dã.
Ước tính tư thế#
Ước tính dáng người phát hiện các điểm khóa cụ thể trong hình ảnh hoặc khung hình video để theo dõi chuyển động hoặc ước tính dáng người. Các điểm khóa này có thể đại diện cho các khớp của con người, các đặc điểm trên khuôn mặt hoặc các điểm quan tâm đáng chú ý khác. YOLO26 xuất sắc trong việc phát hiện điểm khóa với độ chính xác và tốc độ cao, làm cho YOLO26 có giá trị cho các ứng dụng thể dục, phân tích thể thao và tương tác người-máy.
OBB#
Phát hiện Hộp giới hạn có định hướng (OBB) nâng cao việc phát hiện đối tượng truyền thống bằng cách thêm một góc định hướng để định vị tốt hơn các đối tượng xoay vòng. Khả năng này đặc biệt có giá trị đối với phân tích hình ảnh trên không, xử lý tài liệu và các ứng dụng công nghiệp, nơi các đối tượng xuất hiện ở các góc độ khác nhau. YOLO26 mang lại độ chính xác và tốc độ cao để phát hiện các đối tượng xoay vòng trong các kịch bản đa dạng.
Kết luận#
Ultralytics YOLO26 hỗ trợ nhiều tác vụ thị giác máy tính, bao gồm phát hiện, phân đoạn thực thể, phân đoạn ngữ nghĩa, ước tính độ sâu đơn mắt, phân loại, phát hiện điểm khóa và phát hiện đối tượng định hướng. Mỗi tác vụ giải quyết các nhu cầu cụ thể trong bối cảnh thị giác máy tính, từ nhận dạng đối tượng cơ bản đến suy luận độ sâu dày đặc theo từng pixel. Bằng cách hiểu rõ các khả năng và ứng dụng của từng tác vụ, bạn có thể chọn phương pháp phù hợp nhất cho các thách thức thị giác máy tính cụ thể của mình và tận dụng các tính năng mạnh mẽ của YOLO26 để xây dựng các giải pháp hiệu quả.
Tiếp theo là gì?#
Đã chọn được một tác vụ? Định dạng dữ liệu của bạn cho tác vụ đó bằng hướng dẫn Tập dữ liệu, sau đó huấn luyện trên hình ảnh của chính bạn.
FAQ#
Ultralytics YOLO26 là một framework AI đa năng có khả năng thực hiện các tác vụ thị giác máy tính khác nhau với độ chính xác và tốc độ cao. Các tác vụ này bao gồm:
- Phát hiện Đối tượng: Nhận dạng và định vị các đối tượng trong hình ảnh hoặc khung hình video bằng cách vẽ các hộp giới hạn xung quanh các đối tượng đó.
- Instance Segmentation: Tạo ra một mặt nạ cấp độ pixel cho mỗi đối tượng được phát hiện, hữu ích cho các ứng dụng như hình ảnh y tế.
- Phân đoạn Ngữ nghĩa: Gán một nhãn lớp cho mọi pixel trong một hình ảnh để hiểu cảnh dày đặc.
- Depth Estimation: Dự đoán bản đồ độ sâu trên mỗi pixel tính bằng mét từ một hình ảnh RGB duy nhất.
- Phân loại: Phân loại toàn bộ hình ảnh dựa trên nội dung của chúng.
- Pose Estimation: Phát hiện các điểm mấu chốt cụ thể trong một hình ảnh hoặc khung hình video để theo dõi các chuyển động hoặc tư thế.
- Phát hiện Đối tượng Định hướng (OBB): Phát hiện các đối tượng xoay vòng với một góc định hướng bổ sung để tăng độ chính xác.
Để sử dụng Ultralytics YOLO26 cho việc phát hiện đối tượng, hãy làm theo các bước sau:
- Chuẩn bị tập dữ liệu của bạn ở định dạng phù hợp.
- Huấn luyện model YOLO26 sử dụng tác vụ phát hiện.
- Sử dụng model để đưa ra dự đoán bằng cách đưa vào các hình ảnh hoặc khung hình video mới.
Ví dụfrom ultralytics import YOLO # Load a pretrained YOLO model (adjust model type as needed) model = YOLO("yolo26n.pt") # n, s, m, l, x versions available # Perform object detection on an image results = model.predict(source="image.jpg") # Can also use video, directory, URL, etc. # Display the results results[0].show() # Show the first image resultsĐể biết thêm hướng dẫn chi tiết, hãy xem các ví dụ về phát hiện của chúng tôi.
Sử dụng YOLO26 cho các tác vụ phân đoạn mang lại một số ưu điểm:
- Độ chính xác cao: Tác vụ phân đoạn cung cấp các mặt nạ cấp độ pixel chính xác.
- Tốc độ: YOLO26 được tối ưu hóa cho các ứng dụng thời gian thực, cung cấp khả năng xử lý nhanh chóng ngay cả đối với các hình ảnh độ phân giải cao.
- Ứng dụng đa dạng: YOLO26 lý tưởng cho hình ảnh y tế, lái xe tự động và các ứng dụng khác đòi hỏi phân đoạn hình ảnh chi tiết.
Tìm hiểu thêm về lợi ích và trường hợp sử dụng của YOLO26 cho việc phân đoạn trong phần phân đoạn ảnh.
Có, Ultralytics YOLO26 có thể thực hiện hiệu quả việc ước tính dáng người và phát hiện điểm khóa với độ chính xác và tốc độ cao. Tính năng này đặc biệt hữu ích để theo dõi chuyển động trong phân tích thể thao, chăm sóc sức khỏe và các ứng dụng tương tác người-máy. YOLO26 phát hiện các điểm khóa trong hình ảnh hoặc khung hình video, cho phép ước tính dáng người chính xác.
Để biết thêm chi tiết và mẹo triển khai, hãy truy cập các ví dụ về ước tính dáng người của chúng tôi.
Phát hiện Đối tượng Định hướng (OBB) với YOLO26 cung cấp độ chính xác nâng cao bằng cách phát hiện các đối tượng với một tham số góc bổ sung. Tính năng này có lợi cho các ứng dụng đòi hỏi định vị chính xác các đối tượng xoay vòng, chẳng hạn như phân tích hình ảnh trên không và tự động hóa nhà kho.
- Tăng độ chính xác: Thành phần góc làm giảm các kết quả dương tính giả đối với các đối tượng xoay vòng.
- Ứng dụng đa dạng: Hữu ích cho các tác vụ trong phân tích không gian địa lý, robot, v.v.
Hãy xem phần Phát hiện Đối tượng Định hướng để biết thêm chi tiết và ví dụ.