OpenCV

La sortie de NVIDIA DeepStream 9.1 en tant que code open-source a remis une autre pierre angulaire de la vision IA entre les mains de la communauté. Elle s’ajoute à une pile mature d’outils open-source qui couvre déjà tout : du marquage de boîte englobante aux alertes NVR locales : OpenCV pour les classiques, Ultralytics YOLO pour les détecteurs dernière génération, Frigate pour les caméras, CVAT et Label Studio pour le pipeline de données. L’époque du paiement de cinq chiffres pour une suite de vision propriétaire est révolue, à moins que vous n’ayez spécifiquement besoin du support entreprise.

Nous avons sélectionné huit outils de vision par ordinateur open-source que les ingénieurs déploient réellement en 2026, de la recherche à la production. Les huit fonctionnent sur Linux, la plupart sur macOS et Windows aussi, et chacun est publié sous une licence permissive.

Ce qu’il faut chercher dans une application CV open-source

Comparaison rapide

Outil Meilleur pour Licence Caractéristique remarquable
OpenCV Traitement d’image fondamental Apache 2.0 2 500+ algorithmes et une énorme communauté
Ultralytics YOLO Détection d’objet en temps réel AGPL-3.0 YOLO v11/v12 et l’API la plus facile de la vision
Frigate NVR IA pour caméra de sécurité locale MIT Détection sur appareil avec Home Assistant
CVAT Flux de travail d’annotation d’équipe MIT Annotation automatique SAM 3 et YOLO 11
Label Studio Étiquetage multi-modal Apache 2.0 Texte, images, audio, vidéo dans un seul outil
Detectron2 Recherche avancée en détection et segmentation Apache 2.0 Références de qualité production de Meta
FiftyOne Exploration et QA d’ensemble de données Apache 2.0 Tranchage et dés de grands ensembles d’images
MMDetection Kit d’outils de recherche modulaire Apache 2.0 300+ modèles de détection pré-entraînés

Les outils

1. OpenCV — meilleure bibliothèque de traitement d'image fondamental

OpenCV a 25 ans et reste la première dépendance dans la moitié des projets de vision au monde. Il contient plus de 2 500 algorithmes pour le traitement d’image, l’extraction de caractéristiques, l’étalonnage des caméras, le suivi et la stéréoscopie classique. Liaisons pour Python, C++, Java et JavaScript, plus un support natif sur Linux, macOS, Windows, iOS et Android.

Où cela échoue : Les algorithmes classiques sont le cœur ; l’inférence de deep learning via le module DNN d’OpenCV fonctionne, mais vous ferez généralement appel à un framework dédié.

Licence : Apache 2.0 (gratuit pour un usage commercial)

Plateformes : Linux, macOS, Windows, iOS, Android, web

Télécharger : opencv.org · github.com/opencv/opencv

En résumé : Installez-le en premier. Tout en vision s’appuie sur OpenCV quelque part.

2. Ultralytics YOLO — meilleure pile de détection d'objet en temps réel

Ultralytics YOLO est le visage moderne de la famille You Only Look Once. YOLO v11 et v12 sont des détecteurs dernière génération en temps réel, et l’API Python Ultralytics est l’expérience la plus conviviale en vision : trois lignes de code pour entraîner, évaluer et exporter.

Où cela échoue : La licence AGPL est véritablement copyleft ; si vous livrez un produit closed-source, vous avez besoin d’une licence commerciale chez Ultralytics ou vous utilisez un détecteur avec licence permissive (Detectron2, MMDetection).

Licence : AGPL-3.0 (licence commerciale disponible)

Plateformes : Linux, macOS, Windows (Python ; CUDA/ROCm/MPS supportés)

Télécharger : ultralytics.com · github.com/ultralytics/ultralytics

En résumé : Le détecteur de premier aperçu par défaut. Vérifiez la licence avant un déploiement commercial.

3. Frigate NVR — meilleure IA pour caméra de sécurité locale

Frigate est un enregistreur vidéo réseau auto-hébergé avec détection d’objet sur appareil. Il fonctionne sur une Raspberry Pi, un mini-PC ou un serveur domestique puissant, utilise des TPU Coral ou des GPU NVIDIA pour l’inférence, et envoie les événements vers Home Assistant, MQTT et son application native. Chaque clip est stocké localement ; rien ne quitte la maison.

Où cela échoue : La configuration nécessite de lire la documentation. Toutes les caméras grand public ne fonctionnent pas bien ; les flux RTSP sont l’option la plus sûre.

Licence : MIT

Plateformes : Linux (Docker), Windows et macOS via Docker

Télécharger : frigate.video · github.com/blakeblackshear/frigate

En résumé : L’étalon-or pour une configuration de caméra IA entièrement locale et privée.

4. CVAT — meilleure plate-forme d'annotation d'équipe

CVAT (Computer Vision Annotation Tool) est l’épine dorsale open-source de l’étiquetage chez de nombreuses équipes CV. Il s’exécute en tant qu’application web auto-hébergée, prend en charge les boîtes englobantes, les polygones, les points clés et les cuboïdes 3D, et en 2025 a ajouté l’annotation automatique alimentée par SAM 3 et YOLO 11. L’importation et l’exportation couvrent les formats COCO, YOLO, Pascal VOC et TFRecord dès la sortie de l’usine.

Où cela échoue : L’installation auto-hébergée a plusieurs pièces mobiles (Postgres, Redis, worker). L’hébergement SaaS est disponible si vous préférez payer pour ignorer les opérations.

Licence : MIT (open-source), SaaS commercial chez CVAT.ai

Plateformes : Linux, macOS, Windows (Docker) ou SaaS chez CVAT.ai

Télécharger : cvat.ai · github.com/cvat-ai/cvat

En résumé : Le bon choix pour toute équipe étiquetant des données à grande échelle.

5. Label Studio — meilleur outil d'étiquetage multi-modal

Label Studio va plus loin que CVAT : il étiquète images, texte, audio, vidéo et séries temporelles dans une seule interface. Ses modèles personnalisés vous permettent de construire presque n’importe quelle UI d’annotation dont vous avez besoin sans écrire une application complète. L’édition d’équipe ajoute SSO et les permissions.

Où cela échoue : Pour l’annotation d’image pure à grande échelle, CVAT est un meilleur ajustement. Label Studio gagne quand votre ensemble de données mélange les modalités.

Licence : Apache 2.0 (édition communauté), niveaux commerciaux pour les équipes

Plateformes : Linux, macOS, Windows (Docker ou Python)

Télécharger : labelstud.io · github.com/HumanSignal/label-studio

En résumé : Le choix pour les équipes ML multi-modal.

6. Detectron2 — meilleure recherche en détection et segmentation avancée

Detectron2 est la bibliothèque de recherche CV basée sur PyTorch de Meta. Elle fournit des implémentations de référence de qualité production Mask R-CNN, Panoptic FPN et DETR, et alimente une grande partie de la recherche appliquée. Sous le capot, elle est plus explicite qu’Ultralytics YOLO, ce qui est une caractéristique si vous avez besoin de modifier les architectures.

Où cela échoue : Pas convivial pour les débutants. Le développement s’est ralenti par rapport à Ultralytics YOLO ou MMDetection.

Licence : Apache 2.0

Plateformes : Linux, macOS, Windows (PyTorch)

Télécharger : github.com/facebookresearch/detectron2

En résumé : Le bon choix pour les équipes de recherche et de production qui préfèrent les implémentations de référence PyTorch.

7. FiftyOne — meilleur outil d'exploration et de QA d'ensemble de données

FiftyOne par Voxel51 est l’outil que les équipes CV utilisent pour vraiment comprendre ce qui se trouve dans leur ensemble de données. Découpez par confiance de prédiction, mode d’erreur ou qualité par classe ; visualisez les incrustations ; trouvez les quasi-doublons. Il se connecte à tous les formats de modèle et d’étiquette courants.

Où cela échoue : N’est pas un outil d’étiquetage. Associez-le avec CVAT ou Label Studio quand vous avez besoin d’annotations.

Licence : Apache 2.0

Plateformes : Linux, macOS, Windows (Python)

Télécharger : voxel51.com/fiftyone · github.com/voxel51/fiftyone

En résumé : La meilleure façon gratuite d’auditer un ensemble de données CV sans écrire des carnets jetables.

8. MMDetection — meilleur kit d'outils de recherche modulaire

MMDetection d’OpenMMLab est un kit d’outils modulaire avec plus de 300 modèles de détection pré-entraînés. Il lit un fichier de configuration et assemble les backbones, heads et pertes. Si vous avez besoin d’essayer trois architectures sur vos données en un week-end, MMDetection est plus rapide que de les réimplémenter vous-même.

Où cela échoue : L’approche basée sur la configuration est puissante mais a une courbe d’apprentissage abrupte. La qualité de la documentation varie par module.

Licence : Apache 2.0

Plateformes : Linux (recommandé), macOS, Windows (PyTorch)

Télécharger : github.com/open-mmlab/mmdetection

En résumé : Le bon choix pour les équipes de recherche comparant de nombreuses architectures.

Comment choisir la bonne

Une pile pragmatique 2026 pour la plupart du travail appliqué ressemble à OpenCV + Ultralytics YOLO + CVAT + FiftyOne, avec Frigate à côté pour les projets de caméra à domicile.

FAQ

Quelle est la meilleure bibliothèque de vision par ordinateur open-source ?

OpenCV reste la fondation largement utilisée. Pour la détection de deep learning, Ultralytics YOLO est le plus facile pour commencer, et Detectron2 est l’alternative la plus établie soutenue par Meta.

OpenCV est-il vraiment gratuit pour un usage commercial ?

Oui. OpenCV est sous licence Apache 2.0, ce qui permet un usage commercial sans redevances.

Ai-je besoin de CUDA pour la vision par ordinateur ?

Pour le travail OpenCV classique, non. Pour la détection et la segmentation de deep learning avec YOLO, Detectron2 ou MMDetection, un GPU NVIDIA avec CUDA est de loin le chemin le plus lisse. ROCm sur AMD et MPS sur Apple silicon sont viables mais moins testés dans certaines bibliothèques.

Puis-je exécuter des modèles de vision par ordinateur sur une Raspberry Pi ?

Oui. Frigate est conçu pour ce scénario exact, surtout s’il est associé à un Coral USB TPU. Les modèles Ultralytics YOLO nano fonctionnent également sur Pi 5 sans accélération.

Quel outil dois-je utiliser pour étiqueter les images ?

CVAT pour les projets d’annotation intensifs d’images ; Label Studio si vous avez aussi besoin d’annoter du texte, audio ou vidéo dans le même outil. Les deux sont gratuits pour l’auto-hébergement.

NVIDIA DeepStream est-il open-source ?

Oui, depuis la sortie version 9.1 de NVIDIA en 2026, le framework est open-source. C’est particulièrement utile pour les pipelines multi-caméras en streaming sur les appareils Jetson.