Un développeur qui dicte du code sur un ordinateur portable avec un modèle de reconnaissance vocale hors ligne qui transcrit localement

Cette semaine, un journaliste XDA a remarqué que les dernières compilations de VS Code incluent discrètement un modèle de reconnaissance vocale local. Pas de trajet vers le cloud, pas de clé API OpenAI, pas de données quittant la machine. La transcription était, selon ses mots, “étonnamment bonne”. Cette histoire s’aligne sur ce qui s’est passé dans le monde plus large de la parole open-source au cours des deux dernières années : les modèles de classe Whisper s’exécutent maintenant sur un ordinateur portable, en temps réel, sans envoyer l’audio nulle part.

Nous avons testé sept applications de bureau pour la conversion voix en code hors ligne et la dictée en 2026. Chacune d’elles garde l’audio sur l’appareil. Quelques-unes ont été construites spécifiquement pour les codeurs. Le reste sont des outils de dictée généraux qui se connectent à un éditeur.

Ce qui importe dans une application de conversion voix en code hors ligne

Comparaison rapide

Application Meilleur pour Plan gratuit Prix de départ Plateformes
whisper.cpp Transcription Whisper bare-metal n’importe où Application complète Gratuit, open source Windows, macOS, Linux
Talon Voice Codage sans mains avec grammaire réelle Niveau gratuit Environ $15/mois Pro (optionnel) Windows, macOS, Linux
Serenade Commandes vocales dans VS Code Niveau gratuit Environ $10/mois Pro Windows, macOS, Linux
Vosk Petits modèles embarqués Ensemble d’outils complet Gratuit, open source Windows, macOS, Linux
WhisperKit Whisper natif Apple Silicon Framework complet Gratuit, open source macOS
Wispr Flow Dictée à l’échelle du système avec finesse Essai de 7 jours Environ $12/mois macOS, Windows
SuperWhisper Whisper barre de menu hors ligne sur macOS Niveau gratuit Environ $9 une fois ou niveau à vie macOS

Les applications

1. whisper.cpp — Meilleure transcription bare-metal hors ligne

whisper.cpp est le port C++ de Whisper d’OpenAI par Georgi Gerganov. Il s’exécute sur CPU, sur Apple Silicon via Metal, et sur les GPU Nvidia via CUDA. La transcription en continu en temps réel fonctionne avec les modèles small.en ou medium.en sur n’importe quel ordinateur portable de ces cinq dernières années. L’ensemble du runtime est un seul binaire ; Python n’est pas nécessaire.

Où cela échoue : c’est une bibliothèque, pas une GUI. Obtenir du texte dans une application cible signifie utiliser un script qui dirige vers wl-copy, xdotool ou AppleScript.

Tarification :

Plateformes : Windows, macOS, Linux

Télécharger : whisper.cpp sur GitHub

Conclusion : Chaque outil de dictée hors ligne de cette liste utilise whisper.cpp sous le capot ou concurrence avec lui. Commencez ici.

2. Talon Voice — Meilleur codage sans mains

Talon Voice est ce que les développeurs atteints du syndrome du canal carpien à long terme utilisent pour écrire du code entièrement par la voix. Le système de grammaire comprend camelCase, snake_case, SCREAMING_SNAKE et tous les mouvements d’éditeur que nous pourrions demander. Talon s’exécute hors ligne par défaut avec son propre moteur de reconnaissance vocale (modèles Conformer, pas Whisper).

Où cela échoue : la courbe d’apprentissage est réelle. L’écriture de grammaires personnalisées nécessite un après-midi avant que l’application ne soit rentable. Les packs de langue maintenus par la communauté (talon-community) sont essentiels.

Tarification :

Plateformes : Windows, macOS, Linux

Télécharger : Téléchargements Talon Voice

Conclusion : L’étalon-or pour le codage sans mains. Si nous tapons pour vivre, Talon vaut la semaine de configuration.

3. Serenade — Meilleure édition contrôlée par la voix dans VS Code

Serenade se trouve à l’intérieur de VS Code, des IDE JetBrains et des terminaux, écoute les commandes structurées (“add function foo taking user”), et produit le code correspondant. Exécute un modèle de reconnaissance vocale local sur du matériel moderne.

Où cela échoue : le niveau gratuit limite les minutes de voix quotidiennes. La grammaire des commandes est plus stricte que celle de Talon ; la dictée de forme libre n’est pas son point fort.

Tarification :

Plateformes : Windows, macOS, Linux

Télécharger : Téléchargements Serenade

Conclusion : Pour une édition vocale légère dans un IDE grand public, Serenade nécessite moins de configuration que Talon.

4. Vosk — Meilleur petit kit d’outils de reconnaissance vocale hors ligne

Vosk est le kit d’outils de reconnaissance vocale d’Alpha Cephei. Les modèles commencent à 50 Mo (plus petit que le modèle petit de whisper.cpp) et s’exécutent sur le matériel Raspberry Pi. Liaisons natives pour Python, Node, C#, Java et Go.

Où cela échoue : la précision est inférieure aux modèles de classe Whisper en anglais général. Mieux adapté aux grammaires de commande, aux mots d’activation et aux vocabulaires limités.

Tarification :

Plateformes : Windows, macOS, Linux, Android, iOS

Télécharger : Téléchargements Vosk

Conclusion : Pas le choix pour la dictée gratuite. Excellent pour scripter un mot d’activation ou une grammaire de commande stricte dans une application existante.

5. WhisperKit — Meilleure pile Whisper Apple Silicon

WhisperKit est le package Swift d’Argmax qui exécute Whisper sur le Neural Engine d’Apple. Sur un Mac de la série M, medium.en se transcrit à 30 à 60 fois en temps réel en utilisant des watts en un seul chiffre.

Où cela échoue : macOS uniquement. La construction sur celui-ci signifie écrire Swift.

Tarification :

Plateformes : macOS, iOS

Télécharger : WhisperKit sur GitHub

Conclusion : La bibliothèque que chaque application de dictée Mac sérieuse utilise maintenant. Pas quelque chose que nous installons directement, mais la raison pour laquelle SuperWhisper et Wispr Flow se sentent instantanés sur Apple Silicon.

6. Wispr Flow — Meilleure dictée à l’échelle du système avec finesse

Wispr Flow est la chose la plus proche d’une expérience “parlez simplement dans n’importe quel champ de texte”. Déclenchez avec une touche d’accès rapide, parlez, relâchez, et le texte transcrit est inséré où se trouve le curseur. La ponctuation, la capitalisation et le formatage compatible avec le code se produisent tous sur l’appareil.

Où cela échoue : payant après l’essai. macOS est la version mature ; Windows rattrap toujours les options de modèle et les contrôles de barre de menu.

Tarification :

Plateformes : macOS, Windows

Télécharger : Site officiel de Wispr Flow

Conclusion : Si la dictée doit sembler faire partie du système d’exploitation, c’est l’option payante avec le moins de friction.

7. SuperWhisper — Meilleur Whisper barre de menu hors ligne sur macOS

SuperWhisper est une application de barre de menu autonome qui exécute Whisper localement, transcrit dans n’importe quel champ de texte actif, et peut post-traiter la sortie avec un LLM sur appareil (Ollama, LM Studio ou modèles sur appareil d’Apple).

Où cela échoue : macOS uniquement. Le prix unique serait modeste pour une application exclusivement Mac, mais le niveau de mise à niveau “à vie” existe toujours et vaut le prix pour les utilisateurs quotidiens.

Tarification :

Plateformes : macOS

Télécharger : Site officiel de SuperWhisper

Conclusion : Les utilisateurs de Mac qui veulent une dictée hors ligne sans tuyauterie de pipeline : installez-le en cinq minutes et sautez le reste de la liste.

Comment choisir le bon

FAQ

La reconnaissance vocale hors ligne est-elle vraiment aussi bonne que la dictée cloud ? Pour l’anglais, whisper-large-v3 s’exécutant localement est à quelques cheveux près de ce que les services de dictée cloud retournent. Les langues non anglaises traînent toujours derrière les offres cloud, mais l’écart continue de se réduire à chaque sortie de modèle.

Puis-je exécuter ceci sur un CPU sans GPU ? Oui. whisper.cpp, Vosk, Talon et Serenade s’exécutent tous sur CPU. Whisper-medium s’exécute à la vitesse en temps réel sur n’importe quel CPU d’ordinateur portable moderne.

Quelle est la différence entre Whisper et Vosk ? Whisper est un grand modèle basé sur un transformateur entraîné sur l’audio multilingue ; la précision est élevée, les modèles sont plus lourds. Vosk utilise de plus petits modèles optimisés pour la diffusion en continu ; la précision est inférieure pour la dictée générale mais la latence et l’empreinte sont meilleures pour l’utilisation intégrée.

Certains d’entre eux conservent-ils l’audio sur l’appareil à jamais ? Oui. whisper.cpp, Vosk, WhisperKit, Talon (dans sa configuration par défaut) et SuperWhisper sont tous hors ligne. Serenade et Wispr Flow utilisent par défaut les modèles sur appareil mais vérifiez les paramètres si nous traitons l’audio sensible.

La dictée est-elle plus rapide que la dactylographie ? Pour la prose, oui, une fois que nous nous adaptons. Pour le code, cela s’aligne avec la dactylographie tactile après quelques heures de pratique avec Talon ou Serenade. Le plus grand avantage est de pouvoir travailler à travers une blessure au poignet sans perdre la journée.