Meilleures applications pour le contrôle vocal hybride avec Home Assistant en 2026

Un auteur de XDA a câblé un LLM local dans Home Assistant pour la commande vocale, puis l’a désactivé pour la plupart de ce qu’il a dit. Les commandes par mot clé gèrent “allume la lumière de la cuisine” plus vite et ne se trompent jamais, donc le LLM ne s’exécute que lorsqu’une demande est véritablement ouverte. Cette division est la configuration sensée pour une maison remplie de commandes vocales, et elle s’aligne avec le fonctionnement d’Assist lui-même : intentions d’abord, LLM comme secours. Ce sont les meilleures applications pour le contrôle vocal hybride avec Home Assistant sur le bureau, les pièces qui rendent le chemin rapide rapide et gardent le LLM prêt quand un mot clé ne peut pas couvrir la demande.

Nous avons testé huit outils sur les installations Home Assistant OS, Home Assistant Container et Supervised sur Linux, Windows et macOS. Chaque sélection fonctionne avec le protocole Wyoming pour que les pièces s’échangent facilement. Les critères d’évaluation : la rapidité avec laquelle le chemin mot clé se résout, si le LLM peut être appelé par nom ou en cas d’échec, et si l’ensemble du stack reste local quand internet tombe.

Quoi chercher dans une configuration vocale hybride

Comparaison rapide

Application Idéal pour Plateformes Formule gratuite Tier payant Note
Home Assistant Assist Pipeline vocal hybride par défaut Linux, Windows, macOS Entièrement gratuit Aucun 4.7
Rhasspy Voix entièrement hors ligne axée sur les mots clés Linux, Windows, macOS, Docker Entièrement gratuit Aucun 4.6
Wyoming Satellite Transformer un Pi ou un vieux portable en micro de pièce Linux Entièrement gratuit Aucun 4.7
Ollama Conversation Le repli LLM qui s’exécute sur votre machine Linux, Windows, macOS Entièrement gratuit Aucun 4.8
Whisper (Wyoming) Parole en texte locale qui suit le rythme Linux, Windows, macOS Entièrement gratuit Aucun 4.7
Piper (Wyoming) Synthèse vocale locale naturelle Linux, Windows, macOS Entièrement gratuit Aucun 4.7
OpenWakeWord Mots de réveil personnalisés sans entraînement cloud Linux, Windows, macOS Entièrement gratuit Aucun 4.5
Willow Micrologiciel satellite vocal spécialisé Linux, ESP32-S3 Entièrement gratuit Aucun 4.6

Les applications

1. Home Assistant Assist pour voix hybride — Meilleur pipeline par défaut

Home Assistant Assist est le moteur vocal intégré, et depuis la refonte de 2024, il exécute déjà le modèle hybride prêt à l’emploi. Une demande frappe d’abord un correspondant d’intentions rapide, donc “éteins le ventilateur” se résout en millisecondes sans LLM. Tout ce que le correspondant ne peut pas analyser tombe dans l’agent de conversation configuré, où Ollama ou OpenAI se branche. Assist possède également le routage STT et TTS, donc le pipeline est un écran au lieu de cinq.

Où ça échoue : La syntaxe des intentions déroute encore les gens. Les phrases complexes ont besoin d’un déclencheur de phrases ou d’une intention personnalisée, ce qui demande plus de travail que d’éditer une automation.

Tarification :

Plateformes : N’importe quelle installation Home Assistant (Linux, Windows via Docker, macOS via Docker).

Télécharger : home-assistant.io/voice-pe · github.com/home-assistant/core

Conclusion : Commencez ici. Chaque autre sélection ci-dessous étend ou remplace une pièce d’Assist, pas tout.

2. Rhasspy pour voix hybride — Meilleure pile hors ligne axée sur les mots clés

Rhasspy précède Assist et se tient bien quand la priorité est zéro appels cloud. Il résout les commandes à partir d’un fichier de modèle de phrase fixe, ce qui rend la couche mot clé à la fois rapide et prévisible. Rhasspy 3 parle le protocole Wyoming, son STT et son moteur d’intentions s’inscrivent donc dans Home Assistant comme chemin rapide, avec un agent de conversation Ollama comme repli LLM dans Assist.

Où ça échoue : La syntaxe du modèle semble dépassée à côté des intentions d’Assist. Et l’interface est fonctionnelle, pas conviviale.

Tarification :

Plateformes : Linux, Windows, macOS. Fonctionne bien dans Docker sur un Pi 4 ou mieux.

Télécharger : rhasspy.readthedocs.io · github.com/rhasspy/rhasspy3

Conclusion : Choisissez Rhasspy si l’objectif est une pièce qui répond même quand le WAN tombe pendant une semaine.

3. Wyoming Satellite pour voix hybride — Meilleur micro de pièce DIY

Wyoming Satellite transforme un vieux portable, une Raspberry Pi ou un mini PC en point d’extrémité vocal que Home Assistant traite comme un satellite de première classe. La détection du réveil s’exécute sur le satellite, l’audio est envoyé au serveur pour STT, et TTS revient. Cette division permet à un Pi de 35 $ d’être le micro tandis qu’une machine plus puissante exécute Whisper et le LLM, ce qui est la configuration qui garde le modèle hybride rapide.

Où ça échoue : La configuration est un service systemd et un fichier de configuration, pas un assistant. Les satellites alimentés par batterie nécessitent du travail supplémentaire.

Tarification :

Plateformes : Linux (Debian, Ubuntu, Raspberry Pi OS).

Télécharger : github.com/rhasspy/wyoming-satellite

Conclusion : Utilisez-le pour disperser des micros dans toute la maison sans acheter huit copies du même.

4. Ollama Conversation pour voix hybride — Meilleur repli LLM local

Ollama Conversation est l’intégration qui permet à Assist de transférer une demande à un modèle Ollama local quand le correspondant d’intentions abandonne. Llama 3 8B, Qwen 2.5 7B, ou un Phi-3 plus petit fonctionnent tous bien comme cerveau de secours. Le LLM voit les entités exposées comme des outils, il peut donc appeler des méthodes de service quand la demande a de la structure, et répondre de manière conversationnelle quand elle n’en a pas.

Où ça échoue : La première exécution d’un modèle froid peut prendre une seconde sur un GPU modeste. La mise en cache des invites aide, mais un mode de veille à chaud est une vraie décision de GPU.

Tarification :

Plateformes : Linux, Windows, macOS.

Télécharger : ollama.com · github.com/home-assistant/core/tree/dev/homeassistant/components/ollama

Conclusion : Le seul backend LLM à choisir quand le point est de garder toute la boucle vocale hors d’internet.

5. Whisper (Wyoming) pour voix hybride — Meilleure parole en texte local

Whisper avec le wrapper Wyoming est le moteur STT sur lequel aboutissent la plupart des configurations hybrides. Les modèles small.en et base.en sont suffisamment rapides sur CPU pour une maison avec quelques satellites, et medium.en sur un GPU modeste suit une famille se parlant les uns les autres. Whisper lit bien l’intention, donc le chemin rapide par mot clé atterrit plus souvent qu’avec les anciens moteurs.

Où ça échoue : Le choix du modèle compte. Le modèle minuscule se trompe sur les noms et les ordres courts. Base ou small est le minimum pour une vraie configuration.

Tarification :

Plateformes : Linux, Windows, macOS. L’image Docker s’exécute sur ARM et x86.

Télécharger : github.com/rhasspy/wyoming-faster-whisper

Conclusion : Le STT par défaut pour quiconque veut entendre “lumières éteintes” la première fois.

6. Piper (Wyoming) pour voix hybride — Meilleure synthèse vocale locale

Piper est le moteur TTS neuronal qui a fait sonner la voix locale comme un vrai assistant au lieu d’une unité GPS d’une décennie. Les voix sont petites (quelques dizaines de mégaoctets chacune), l’inférence sur CPU uniquement est rapide, et le catalogue couvre des dizaines de langues. Piper gère à la fois les confirmations brèves (“d’accord”) et les réponses LLM plus longues sans décalage entre eux.

Où ça échoue : Certaines voix sonnent minces à côté d’un TTS cloud. Le clonage vocal reste hors de portée, ce qui convient à la plupart des foyers.

Tarification :

Plateformes : Linux, Windows, macOS.

Télécharger : github.com/rhasspy/piper

Conclusion : Le bon TTS pour une pile hybride où le foyer entend la sortie toute la journée.

7. OpenWakeWord pour voix hybride — Meilleur mot de réveil personnalisé

OpenWakeWord entraîne un mot de réveil sans envoyer d’audio nulle part. C’est important pour les configurations hybrides car un mauvais mot de réveil est ce qui casse l’illusion axée sur les mots clés : un faux réveil envoie la vraie parole à STT, puis à LLM, et le foyer entend le ventilateur tourner. OpenWakeWord est livré avec plusieurs modèles prêts et un notebook Colab pour un nouveau.

Où ça échoue : Un mot personnalisé de qualité a besoin de quelques milliers d’échantillons générés. “Alexa”, “Hey Jarvis” et “Hey Rhasspy” préentraînés sont les choix à faible effort.

Tarification :

Plateformes : Linux, Windows, macOS.

Télécharger : github.com/dscripka/openWakeWord

Conclusion : Le bon choix quand le nom du foyer n’est pas un des mots de réveil préentraînés.

8. Willow pour voix hybride — Meilleur micrologiciel satellite spécialisé

Willow est un micrologiciel de satellite vocal pour ESP32-S3-BOX et cartes de développement similaires, et traite Home Assistant Assist comme un backend de première classe. La détection du réveil au niveau du dispositif signifie qu’aucun trafic ne quitte l’appareil jusqu’à ce qu’il vous entende, et tout l’aller-retour est assez rapide pour que les commandes par mot clé se sentent instantanées. Le serveur d’inférence de Willow peut également héberger Whisper et LLMs si la charge de travail doit vivre dans une boîte.

Où ça échoue : Le matériel est un petit ensemble. L’approvisionnement en ESP32-S3-BOX va et vient.

Tarification :

Plateformes : Linux (pour le serveur d’inférence), ESP32-S3-BOX et matériel compatible.

Télécharger : heywillow.io · github.com/toverainc/willow

Conclusion : Utilisez Willow quand les satellites doivent être minuscules, silencieux et toujours à l’écoute sans PC dans la pièce.

Comment choisir le bon

FAQ

Quel est le meilleur LLM local pour le contrôle vocal Home Assistant ?
Llama 3 8B et Qwen 2.5 7B fonctionnent tous deux bien lorsqu’ils sont associés au wrapper d’appel d’outils qu’Assist expose. Les petits modèles Phi-3 fonctionnent sur des boîtes CPU uniquement mais manquent plus d’appels de service. Le bon modèle est le plus grand qui maintient une demande sous deux secondes sur votre GPU.

Puis-je utiliser le contrôle vocal Home Assistant sans connexion Internet ?
Oui. Whisper, Piper, Ollama et Assist fonctionnent tous localement, et Wyoming Satellite porte l’audio sur le LAN. La pile survit à une panne d’Internet tant que le serveur et les satellites sont sur le même réseau.

Ai-je besoin d’un GPU pour exécuter un LLM local pour le contrôle vocal Home Assistant ?
Non pour les plus petits modèles. Un modèle 7B quantifié en Q4 s’exécute sur un CPU moderne ou un GPU de gamme moyenne. Un GPU est ce qui maintient le temps de réponse sous une seconde, ce qui rend la voix temps réel.

Comment faire en sorte que Home Assistant Assist utilise les mots clés en premier et le LLM uniquement comme repli ?
Assist le fait déjà. Dans Paramètres, définissez l’agent Conversation du pipeline sur un LLM. Les intentions s’exécutent en premier, et seules les demandes non correspondantes atteignent le LLM. Les phrases personnalisées dans intents.yaml ajoutent une couverture de mots clés supplémentaire.

Quelle est la différence entre Rhasspy et Home Assistant Assist ?
Rhasspy est le plus ancien moteur axé sur les mots clés, basé sur des modèles, qui s’exécute seul ou en tant que fournisseur STT/intention d’Assist. Assist est l’intégration plus récente et plus serrée intégrée dans Home Assistant avec repli LLM intégré. La plupart des configurations 2026 utilisent Assist et empruntent les idées de Rhasspy.