Wizja komputerowa to dziedzina sztucznej inteligencji, której celem jest umożliwienie maszynom interpretacji i rozumienia obrazów oraz filmów w sposób zbliżony do ludzkiego. Zakres obejmuje ekstrakcję, analizę i rozpoznawanie informacji wizualnych z surowych danych pochodzących z sensorów obrazu. W odróżnieniu od prostego przechwytywania obrazów, wizja komputerowa pozwala przekształcać dane w użyteczne informacje, automatyzując złożone zadania, takie jak rozpoznawanie obiektów czy analiza scen. Technologia ta wyróżnia się na tle klasycznego przetwarzania obrazu szerokim wykorzystaniem uczenia maszynowego i głębokich sieci neuronowych.
Przykłady zastosowań i użycia
Wizja komputerowa jest wykorzystywana m.in. w rozpoznawaniu twarzy (bezpieczeństwo), analizie obrazów medycznych (diagnoza), automatycznej inspekcji w przemyśle, autonomicznej jeździe, automatycznym odczycie tablic rejestracyjnych czy sortowaniu produktów spożywczych. W handlu detalicznym wspiera inteligentne zarządzanie zapasami i monitoring. W rolnictwie umożliwia wykrywanie chorób upraw na podstawie zdjęć satelitarnych lub dronowych.
Główne narzędzia, biblioteki i frameworki
Najpopularniejsze narzędzia to OpenCV, TensorFlow, PyTorch, Keras i Detectron2, oferujące moduły do detekcji obiektów, segmentacji obrazów, śledzenia ruchu oraz rozpoznawania wzorców. Rozwiązania takie jak YOLO, Faster R-CNN czy MMDetection są cenione za wydajność w detekcji czasu rzeczywistego. Do anotacji danych używa się platform LabelImg lub CVAT.
Najnowsze trendy i rozwój
Wizja komputerowa korzysta z postępów w deep learningu, m.in. architektur transformerów wizualnych (ViT) oraz modeli multimodalnych łączących obraz i tekst. Optymalizacja modeli pod urządzenia wbudowane i rosnące wykorzystanie AI generatywnej otwierają nowe zastosowania. Algorytmy samo-nadzorowane oraz trening na dużych zbiorach danych dodatkowo zwiększają dostępność i skuteczność wizji komputerowej w różnych środowiskach.