
Un auteur de XDA a câblé un LLM local dans Home Assistant pour la commande vocale, puis l’a désactivé pour la plupart de ce qu’il a dit. Les commandes par mot clé gèrent “allume la lumière de la cuisine” plus vite et ne se trompent jamais, donc le LLM ne s’exécute que lorsqu’une demande est véritablement ouverte. Cette division est la configuration sensée pour une maison remplie de commandes vocales, et elle s’aligne avec le fonctionnement d’Assist lui-même : intentions d’abord, LLM comme secours. Ce sont les meilleures applications pour le contrôle vocal hybride avec Home Assistant sur le bureau, les pièces qui rendent le chemin rapide rapide et gardent le LLM prêt quand un mot clé ne peut pas couvrir la demande.
Nous avons testé huit outils sur les installations Home Assistant OS, Home Assistant Container et Supervised sur Linux, Windows et macOS. Chaque sélection fonctionne avec le protocole Wyoming pour que les pièces s’échangent facilement. Les critères d’évaluation : la rapidité avec laquelle le chemin mot clé se résout, si le LLM peut être appelé par nom ou en cas d’échec, et si l’ensemble du stack reste local quand internet tombe.
Quoi chercher dans une configuration vocale hybride
- Intentions en premier, LLM en second. L’outil doit essayer les intentions par mot clé avant de toucher un modèle de langage.
- Support du protocole Wyoming. Mot de réveil, STT, TTS et satellites communiquent avec Home Assistant sur un seul fil commun.
- Chemin complètement hors ligne. Chaque couche s’exécute sur le réseau local si nécessaire.
- Invocation explicite de LLM. Une phrase, un préfixe ou une entité qui promeut intentionnellement une demande vers le LLM.
- Réglage par satellite. Un satellite de cuisine peut utiliser un mot de réveil et une chambre une autre.
- Échange de modèle sans reflashing. La taille de Whisper, la voix de Piper et le backend LLM changent depuis l’interface.
Comparaison rapide
| Application | Idéal pour | Plateformes | Formule gratuite | Tier payant | Note |
|---|---|---|---|---|---|
| Home Assistant Assist | Pipeline vocal hybride par défaut | Linux, Windows, macOS | Entièrement gratuit | Aucun | 4.7 |
| Rhasspy | Voix entièrement hors ligne axée sur les mots clés | Linux, Windows, macOS, Docker | Entièrement gratuit | Aucun | 4.6 |
| Wyoming Satellite | Transformer un Pi ou un vieux portable en micro de pièce | Linux | Entièrement gratuit | Aucun | 4.7 |
| Ollama Conversation | Le repli LLM qui s’exécute sur votre machine | Linux, Windows, macOS | Entièrement gratuit | Aucun | 4.8 |
| Whisper (Wyoming) | Parole en texte locale qui suit le rythme | Linux, Windows, macOS | Entièrement gratuit | Aucun | 4.7 |
| Piper (Wyoming) | Synthèse vocale locale naturelle | Linux, Windows, macOS | Entièrement gratuit | Aucun | 4.7 |
| OpenWakeWord | Mots de réveil personnalisés sans entraînement cloud | Linux, Windows, macOS | Entièrement gratuit | Aucun | 4.5 |
| Willow | Micrologiciel satellite vocal spécialisé | Linux, ESP32-S3 | Entièrement gratuit | Aucun | 4.6 |
Les applications
1. Home Assistant Assist pour voix hybride — Meilleur pipeline par défaut
Home Assistant Assist est le moteur vocal intégré, et depuis la refonte de 2024, il exécute déjà le modèle hybride prêt à l’emploi. Une demande frappe d’abord un correspondant d’intentions rapide, donc “éteins le ventilateur” se résout en millisecondes sans LLM. Tout ce que le correspondant ne peut pas analyser tombe dans l’agent de conversation configuré, où Ollama ou OpenAI se branche. Assist possède également le routage STT et TTS, donc le pipeline est un écran au lieu de cinq.
Où ça échoue : La syntaxe des intentions déroute encore les gens. Les phrases complexes ont besoin d’un déclencheur de phrases ou d’une intention personnalisée, ce qui demande plus de travail que d’éditer une automation.
Tarification :
- Gratuit : Entièrement gratuit avec un pipeline local.
- Payant : Nabu Casa à partir d’environ 6,50 $/mois héberge le STT et TTS cloud si vous ne voulez pas les exécuter localement.
Plateformes : N’importe quelle installation Home Assistant (Linux, Windows via Docker, macOS via Docker).
Télécharger : home-assistant.io/voice-pe · github.com/home-assistant/core
Conclusion : Commencez ici. Chaque autre sélection ci-dessous étend ou remplace une pièce d’Assist, pas tout.
2. Rhasspy pour voix hybride — Meilleure pile hors ligne axée sur les mots clés
Rhasspy précède Assist et se tient bien quand la priorité est zéro appels cloud. Il résout les commandes à partir d’un fichier de modèle de phrase fixe, ce qui rend la couche mot clé à la fois rapide et prévisible. Rhasspy 3 parle le protocole Wyoming, son STT et son moteur d’intentions s’inscrivent donc dans Home Assistant comme chemin rapide, avec un agent de conversation Ollama comme repli LLM dans Assist.
Où ça échoue : La syntaxe du modèle semble dépassée à côté des intentions d’Assist. Et l’interface est fonctionnelle, pas conviviale.
Tarification :
- Gratuit : Entièrement gratuit.
- Payant : Aucun.
Plateformes : Linux, Windows, macOS. Fonctionne bien dans Docker sur un Pi 4 ou mieux.
Télécharger : rhasspy.readthedocs.io · github.com/rhasspy/rhasspy3
Conclusion : Choisissez Rhasspy si l’objectif est une pièce qui répond même quand le WAN tombe pendant une semaine.
3. Wyoming Satellite pour voix hybride — Meilleur micro de pièce DIY
Wyoming Satellite transforme un vieux portable, une Raspberry Pi ou un mini PC en point d’extrémité vocal que Home Assistant traite comme un satellite de première classe. La détection du réveil s’exécute sur le satellite, l’audio est envoyé au serveur pour STT, et TTS revient. Cette division permet à un Pi de 35 $ d’être le micro tandis qu’une machine plus puissante exécute Whisper et le LLM, ce qui est la configuration qui garde le modèle hybride rapide.
Où ça échoue : La configuration est un service systemd et un fichier de configuration, pas un assistant. Les satellites alimentés par batterie nécessitent du travail supplémentaire.
Tarification :
- Gratuit : Entièrement gratuit.
- Payant : Aucun.
Plateformes : Linux (Debian, Ubuntu, Raspberry Pi OS).
Télécharger : github.com/rhasspy/wyoming-satellite
Conclusion : Utilisez-le pour disperser des micros dans toute la maison sans acheter huit copies du même.
4. Ollama Conversation pour voix hybride — Meilleur repli LLM local
Ollama Conversation est l’intégration qui permet à Assist de transférer une demande à un modèle Ollama local quand le correspondant d’intentions abandonne. Llama 3 8B, Qwen 2.5 7B, ou un Phi-3 plus petit fonctionnent tous bien comme cerveau de secours. Le LLM voit les entités exposées comme des outils, il peut donc appeler des méthodes de service quand la demande a de la structure, et répondre de manière conversationnelle quand elle n’en a pas.
Où ça échoue : La première exécution d’un modèle froid peut prendre une seconde sur un GPU modeste. La mise en cache des invites aide, mais un mode de veille à chaud est une vraie décision de GPU.
Tarification :
- Gratuit : Entièrement gratuit.
- Payant : Aucun. Les téléchargements de modèles sont gratuits.
Plateformes : Linux, Windows, macOS.
Télécharger : ollama.com · github.com/home-assistant/core/tree/dev/homeassistant/components/ollama
Conclusion : Le seul backend LLM à choisir quand le point est de garder toute la boucle vocale hors d’internet.
5. Whisper (Wyoming) pour voix hybride — Meilleure parole en texte local
Whisper avec le wrapper Wyoming est le moteur STT sur lequel aboutissent la plupart des configurations hybrides. Les modèles small.en et base.en sont suffisamment rapides sur CPU pour une maison avec quelques satellites, et medium.en sur un GPU modeste suit une famille se parlant les uns les autres. Whisper lit bien l’intention, donc le chemin rapide par mot clé atterrit plus souvent qu’avec les anciens moteurs.
Où ça échoue : Le choix du modèle compte. Le modèle minuscule se trompe sur les noms et les ordres courts. Base ou small est le minimum pour une vraie configuration.
Tarification :
- Gratuit : Entièrement gratuit.
- Payant : Aucun.
Plateformes : Linux, Windows, macOS. L’image Docker s’exécute sur ARM et x86.
Télécharger : github.com/rhasspy/wyoming-faster-whisper
Conclusion : Le STT par défaut pour quiconque veut entendre “lumières éteintes” la première fois.
6. Piper (Wyoming) pour voix hybride — Meilleure synthèse vocale locale
Piper est le moteur TTS neuronal qui a fait sonner la voix locale comme un vrai assistant au lieu d’une unité GPS d’une décennie. Les voix sont petites (quelques dizaines de mégaoctets chacune), l’inférence sur CPU uniquement est rapide, et le catalogue couvre des dizaines de langues. Piper gère à la fois les confirmations brèves (“d’accord”) et les réponses LLM plus longues sans décalage entre eux.
Où ça échoue : Certaines voix sonnent minces à côté d’un TTS cloud. Le clonage vocal reste hors de portée, ce qui convient à la plupart des foyers.
Tarification :
- Gratuit : Entièrement gratuit.
- Payant : Aucun.
Plateformes : Linux, Windows, macOS.
Télécharger : github.com/rhasspy/piper
Conclusion : Le bon TTS pour une pile hybride où le foyer entend la sortie toute la journée.
7. OpenWakeWord pour voix hybride — Meilleur mot de réveil personnalisé
OpenWakeWord entraîne un mot de réveil sans envoyer d’audio nulle part. C’est important pour les configurations hybrides car un mauvais mot de réveil est ce qui casse l’illusion axée sur les mots clés : un faux réveil envoie la vraie parole à STT, puis à LLM, et le foyer entend le ventilateur tourner. OpenWakeWord est livré avec plusieurs modèles prêts et un notebook Colab pour un nouveau.
Où ça échoue : Un mot personnalisé de qualité a besoin de quelques milliers d’échantillons générés. “Alexa”, “Hey Jarvis” et “Hey Rhasspy” préentraînés sont les choix à faible effort.
Tarification :
- Gratuit : Entièrement gratuit.
- Payant : Aucun.
Plateformes : Linux, Windows, macOS.
Télécharger : github.com/dscripka/openWakeWord
Conclusion : Le bon choix quand le nom du foyer n’est pas un des mots de réveil préentraînés.
8. Willow pour voix hybride — Meilleur micrologiciel satellite spécialisé
Willow est un micrologiciel de satellite vocal pour ESP32-S3-BOX et cartes de développement similaires, et traite Home Assistant Assist comme un backend de première classe. La détection du réveil au niveau du dispositif signifie qu’aucun trafic ne quitte l’appareil jusqu’à ce qu’il vous entende, et tout l’aller-retour est assez rapide pour que les commandes par mot clé se sentent instantanées. Le serveur d’inférence de Willow peut également héberger Whisper et LLMs si la charge de travail doit vivre dans une boîte.
Où ça échoue : Le matériel est un petit ensemble. L’approvisionnement en ESP32-S3-BOX va et vient.
Tarification :
- Gratuit : Micrologiciel entièrement gratuit.
- Payant : Aucun.
Plateformes : Linux (pour le serveur d’inférence), ESP32-S3-BOX et matériel compatible.
Télécharger : heywillow.io · github.com/toverainc/willow
Conclusion : Utilisez Willow quand les satellites doivent être minuscules, silencieux et toujours à l’écoute sans PC dans la pièce.
Comment choisir le bon
- Si vous voulez le pipeline hybride le plus simple : Home Assistant Assist avec Ollama Conversation comme repli et Whisper plus Piper pour STT et TTS.
- Si vous voulez une dépendance zéro au cloud : Rhasspy pour la couche d’intentions, plus Ollama pour le repli LLM et Piper pour TTS.
- Si vous avez déjà un Pi de rechange : Wyoming Satellite pour que le Pi devienne le micro et le LLM vive sur une boîte plus grande.
- Si les mots de réveil se déclenchent faussement : OpenWakeWord avec un mot spécifique au foyer.
- Si vous avez essayé Assist et détesté la configuration : Willow flashe ESP32-S3-BOX en quelques minutes et parle Assist nativement.
FAQ
Quel est le meilleur LLM local pour le contrôle vocal Home Assistant ?
Llama 3 8B et Qwen 2.5 7B fonctionnent tous deux bien lorsqu’ils sont associés au wrapper d’appel d’outils qu’Assist expose. Les petits modèles Phi-3 fonctionnent sur des boîtes CPU uniquement mais manquent plus d’appels de service. Le bon modèle est le plus grand qui maintient une demande sous deux secondes sur votre GPU.
Puis-je utiliser le contrôle vocal Home Assistant sans connexion Internet ?
Oui. Whisper, Piper, Ollama et Assist fonctionnent tous localement, et Wyoming Satellite porte l’audio sur le LAN. La pile survit à une panne d’Internet tant que le serveur et les satellites sont sur le même réseau.
Ai-je besoin d’un GPU pour exécuter un LLM local pour le contrôle vocal Home Assistant ?
Non pour les plus petits modèles. Un modèle 7B quantifié en Q4 s’exécute sur un CPU moderne ou un GPU de gamme moyenne. Un GPU est ce qui maintient le temps de réponse sous une seconde, ce qui rend la voix temps réel.
Comment faire en sorte que Home Assistant Assist utilise les mots clés en premier et le LLM uniquement comme repli ?
Assist le fait déjà. Dans Paramètres, définissez l’agent Conversation du pipeline sur un LLM. Les intentions s’exécutent en premier, et seules les demandes non correspondantes atteignent le LLM. Les phrases personnalisées dans intents.yaml ajoutent une couverture de mots clés supplémentaire.
Quelle est la différence entre Rhasspy et Home Assistant Assist ?
Rhasspy est le plus ancien moteur axé sur les mots clés, basé sur des modèles, qui s’exécute seul ou en tant que fournisseur STT/intention d’Assist. Assist est l’intégration plus récente et plus serrée intégrée dans Home Assistant avec repli LLM intégré. La plupart des configurations 2026 utilisent Assist et empruntent les idées de Rhasspy.