
L’article de XDA sur l’association de caméras locales à l’IA de Home Assistant a touché un nerf pour une raison. Le défaut de la plupart des caméras intelligentes reste “le fournisseur voit d’abord le flux”. Home Assistant plus Frigate plus un LLM dans un Ollama local inverse cela : le flux RTSP brut va à un serveur local, la détection d’objets s’exécute sur une Coral ou un GPU, et le LLM ne touche que les images que le détecteur d’objets a déjà marquées. Rien ne quitte la maison.
Les composants sont open source et évoluent rapidement. Sept applications de bureau pour que la vision par caméra IA de Home Assistant fonctionne réellement, classées de sorte que la première est où commence chaque installation et la dernière est où cela cesse d’importer.
Ce qu’il faut chercher dans une pile d’IA de caméra locale
Le pipeline se divise en quatre tâches :
- Ingérez des flux RTSP ou ONVIF sans les faire passer par le cloud du fournisseur.
- Détection d’objets à la fréquence d’images sur du matériel bon marché. Coral Edge TPU pour les accélérateurs USB, Frigate pour la couche logicielle.
- Analyse de scène avec un LLM qui peut décrire ce qui se trouve dans un cadre de délimitation en langage naturel (“un colis sur le porche”, “un raton laveur dans la poubelle”).
- Routage d’événements dans Home Assistant pour que les notifications, l’automatisation et les tableaux de bord puissent réagir.
Tout ce qui suit s’exécute entièrement sur le matériel que vous possédez, sur un bureau ou un nœud homelab Windows, macOS ou Linux.
Comparaison rapide
| Application | Meilleur pour | Licence | Minimum matériel | Point fort |
|---|---|---|---|---|
| Home Assistant | Le hub auquel tous les autres outils se connectent | Apache 2.0 | 2 GB RAM | Meilleur routeur d’automatisation de cette liste |
| Frigate | Détection d’objets locale à fréquence d’images | MIT | 4 GB RAM, Coral ou GPU | Le plus rapide NVR local qui parle MQTT |
| LLM Vision | Descriptions en langage naturel des événements de caméra | MIT | Utilise le matériel de votre LLM | Transforme les cadres de délimitation en phrases lisibles |
| Scrypted | Ingestion de caméra et passerelle HomeKit Apple | MIT | 2 GB RAM | Meilleur moyen d’exposer les caméras non-HomeKit à HomeKit |
| Blue Iris | NVR natif Windows avec interface mature | Proprietary | Windows PC | Le poids lourd Windows ; enregistrement solide |
| MQTT Explorer | Outil de débogage pour les messages Frigate → Home Assistant | MIT | 200 MB RAM | Lit tout le trafic émis par Frigate |
| Ollama | LLM local auquel parle LLM Vision | MIT | 8 GB RAM + GPU utile | Où s’exécute le modèle multimodal |
Les applications
1. Home Assistant — Meilleur hub
Home Assistant est le hub vers lequel tous les intégrations de caméra de cette pile pointent. Il gère le modèle d’entité, l’automatisation déclenchée par les événements Frigate, les tableaux de bord qui affichent le dernier cliché, les notifications vers les téléphones et l’interface de paramètres pour LLM Vision. Même si vous exécutez déjà Blue Iris ou Scrypted pour l’enregistrement, Home Assistant est l’endroit où vit la logique “raton laveur dans la poubelle → allumer la lumière → envoyer notification”.
Où il manque : HAOS a des opinions fortes sur la propriété de son hôte. Dans Docker, vous perdez les modules complémentaires du superviseur. Courbe d’apprentissage complète au-delà des bases.
Tarification :
- Gratuit, Apache 2.0
- Nabu Casa Cloud à $6,50/mois ajoute l’accès à distance sans exposer de port
Plateformes : Linux (HAOS ou Docker), Windows ou macOS via VM/Docker Desktop.
Télécharger : Home Assistant
Conclusion : Installez d’abord. Chaque autre application de cette liste suppose que c’est là.
2. Frigate — Meilleur NVR local et détection d’objets
Frigate est ce qui transforme le RTSP brut en “personne à la porte”, “voiture dans l’allée” ou “colis livré”. Il extrait les flux de vos caméras, exécute la détection sur une Coral Edge TPU ou un GPU, publie les événements via MQTT pour que Home Assistant les consomme, et enregistre uniquement les événements qui vous intéressent. La version 2026 a ajouté un plug-in LLM natif qui envoie les captures directement à un modèle multimodal.
Où il manque : L’utilisation de la RAM augmente avec le nombre de caméras. Coral TPU est officiellement recommandée et ne reste pas toujours en stock. La configuration YAML est longue la première fois.
Tarification :
- Gratuit, sous licence MIT
- Le module Frigate+ avec modèle entraîné payant à $50/an est optionnel
Plateformes : Linux (Docker), meilleur sur x86_64 avec un accélérateur USB Coral ou un GPU nVidia.
Télécharger : Frigate NVR
Conclusion : Installez en deuxième. C’est la raison pour laquelle “les caméras IA sans le cloud” est une réalité.
3. LLM Vision — Meilleur pour les descriptions d’événements lisibles
LLM Vision est l’intégration Home Assistant qui envoie les captures et les clips de caméra à un LLM multimodal et retourne une description en langage naturel. Cela fonctionne avec Ollama, OpenAI, Anthropic, Google Gemini et n’importe quel point de terminaison compatible OpenAI. En pratique : Frigate marque une “personne” à la porte d’entrée, LLM Vision demande à Ollama “décrivez ce que fait cette personne”, et le résumé arrive comme notification téléphonique.
Où il manque : Les descriptions ne sont aussi bonnes que le modèle qui les sous-tend. Les petits modèles de vision hallucinent occasionnellement. La latence sur un GPU domestique est perceptible.
Tarification :
- Gratuit, MIT
Plateformes : S’exécute dans Home Assistant ; le LLM sous-jacent vit où vous l’hébergez (Ollama sur Linux, LM Studio, OpenAI dans le cloud).
Télécharger : LLM Vision sur GitHub
Conclusion : Installez après Frigate. C’est ce qui transforme les cadres de délimitation en “quelqu’un a laissé un sac à la porte”.
4. Scrypted — Meilleur pour ingestion de caméra et passerelle HomeKit
Scrypted est le couteau suisse pour les caméras qui ne parlent pas le protocole que vous voulez. Il extrait RTSP, ONVIF, Ring, Nest, Reolink, Amcrest et les réexpose en tant que HomeKit Secure Video, RTSP ou WebRTC. Dans un ménage mélangeant “caméra bon marché parlant RTSP” et “utilisateur iPhone qui veut HomeKit”, Scrypted est le traducteur.
Où il manque : Pas lui-même un détecteur d’objets avec la même qualité que Frigate. Deux outils s’exécutant en parallèle est courant.
Tarification :
- Gratuit, MIT
- Module NVR optionnel avec abonnement pour la synchronisation cloud
Plateformes : Linux (Docker), Windows, macOS.
Télécharger : Scrypted
Conclusion : Installez quand le ménage mélange les caméras de plusieurs écosystèmes.
5. Blue Iris — Meilleur NVR natif Windows
Blue Iris est l’ancien combattant. S’exécute sur un PC Windows, enregistre sur le disque local, s’intègre à Home Assistant via MQTT, et son tableau de bord est le plus poli du domaine. Associez avec Frigate pour l’IA ou avec sa propre intégration DeepStack/CodeProject.AI pour la détection d’objets.
Où il manque : Windows uniquement. Propriétaire. L’interface est l’esprit des années 2010 de Windows.
Tarification :
- Licence unique environ $70 (LE) à $130 (Full)
- Essai gratuit disponible
Plateformes : Windows.
Télécharger : Blue Iris
Conclusion : Meilleur choix quand une machine Windows est déjà le serveur domestique toujours actif.
6. MQTT Explorer — Meilleur outil de débogage du pipeline
MQTT Explorer est l’outil que vous ouvrez quand Frigate émet des événements, Home Assistant ne réagit pas, et vous avez besoin de voir le trafic entre eux. Il s’abonne à n’importe quel arbre de rubriques, affiche l’historique dans un flux en direct et vous permet de republier les messages pour tester l’automatisation. Une fois le pipeline stable, vous ne le touchez plus ; pendant que vous le configurez, c’est essentiel.
Où il manque : Pas vraiment une “application” que vous exécutez quotidiennement. Code source disponible plutôt que complètement open source.
Tarification :
- Gratuit
Plateformes : Windows, macOS, Linux.
Télécharger : MQTT Explorer
Conclusion : Installez une fois, utilisez pendant une semaine pendant le câblage, oubliez que vous l’avez.
7. Ollama — Meilleur LLM local pour soutenir LLM Vision
Ollama est l’exécution où s’exécute réellement le modèle multimodal local. LLaVA et ses descendants, Qwen2.5-VL, moondream et autres petits modèles de vision s’extraient avec quelques commandes et s’exécutent heureux sur un GPU ou Apple Silicon. LLM Vision pointe vers le point de terminaison Ollama et chaque capture d’événement fait un aller-retour à travers celui-ci.
Où il manque : GPU ou Apple Silicon fortement recommandé pour la vitesse. CPU uniquement est possible mais lent. Le choix du modèle affecte la qualité de la description.
Tarification :
- Gratuit, MIT
Plateformes : Linux, macOS, Windows.
Télécharger : Ollama
Conclusion : Installez comme le moteur derrière LLM Vision quand vous voulez que tout soit local.
Comment choisir le bon
Si vous partez de zéro : Home Assistant d’abord, Frigate deuxième, LLM Vision troisième avec un petit modèle de vision sur Ollama. C’est la pile de référence.
Si Apple HomeKit compte : ajoutez Scrypted pour exposer les caméras non-HomeKit.
Si le serveur domestique est déjà une boîte Windows : Blue Iris prend le rôle du NVR et envoie les événements à Home Assistant.
Quand Frigate ne déclenche pas l’automatisation que vous attendez : MQTT Explorer pour voir ce qui est réellement publié.
Si les LLM cloud sont acceptables : ignorez Ollama et pointez LLM Vision vers OpenAI ou Gemini pour une qualité de description plus élevée au détriment de quitter la maison.
FAQ
Home Assistant peut-il faire de l’IA de caméra sans Frigate ?
Il existe des intégrations plus légères (détection de mouvement par l’intégration de caméra elle-même, DeepStack, CodeProject.AI). Frigate est l’endroit où vit la meilleure détection d’objets locale actuellement. La plupart des gens finissent par s’y installer.
Ai-je besoin d’une Coral Edge TPU ?
Fortement recommandé. Frigate s’exécute sur CPU mais à une fraction de la fréquence d’images. Un seul stick USB Coral gère 3 à 5 caméras confortablement. Un GPU fonctionne aussi, avec un coût énergétique plus élevé.
Quel LLM est le meilleur pour LLM Vision ?
Pour local, Qwen2.5-VL et moondream sont les favoris actuels sur du matériel modeste. Pour le cloud, GPT-5 ou Gemini-2.5-Pro produisent des descriptions nettement meilleures au détriment de la confidentialité.
Puis-je exécuter cela complètement sans cloud ?
Oui. Home Assistant + Frigate + LLM Vision + Ollama couvre tout le pipeline localement. Seules les notifications téléphoniques quittent la maison, et même celles-ci peuvent être routées via un serveur Ntfy ou Gotify auto-hébergé.
Cela fonctionne-t-il avec les caméras sans fil ?
N’importe quelle caméra qui émet RTSP ou prend en charge ONVIF fonctionne. Les caméras Wi-Fi vont bien ; un réseau stable importe plus qu’une caméra filaire.