Cette semaine, un journaliste XDA a remarqué que les dernières compilations de VS Code incluent discrètement un modèle de reconnaissance vocale local. Pas de trajet vers le cloud, pas de clé API OpenAI, pas de données quittant la machine. La transcription était, selon ses mots, “étonnamment bonne”. Cette histoire s’aligne sur ce qui s’est passé dans le monde plus large de la parole open-source au cours des deux dernières années : les modèles de classe Whisper s’exécutent maintenant sur un ordinateur portable, en temps réel, sans envoyer l’audio nulle part.
Nous avons testé sept applications de bureau pour la conversion voix en code hors ligne et la dictée en 2026. Chacune d’elles garde l’audio sur l’appareil. Quelques-unes ont été construites spécifiquement pour les codeurs. Le reste sont des outils de dictée généraux qui se connectent à un éditeur.
Ce qui importe dans une application de conversion voix en code hors ligne
- Tout sur l’appareil. L’audio et la transcription restent sur la machine, vérifiables avec le câble réseau débranché.
- Véritable prise de conscience du code. Nommer une variable “cammel case getUserId” devrait produire
getUserId, pas “camel case get user id”. - Mode commande. Une grammaire vocale pour les commandes de l’éditeur : “ligne 42”, “supprimer le mot”, “exécuter le test”.
- Faible latence. La transcription en continu en dessous de 500 ms semble utilisable. Tout ce qui dépasse une seconde et nous cessons de lui faire confiance.
- Précision multiplateforme. La qualité du modèle baisse sur les langues non latines et les accents prononcés. Les bonnes applications nous permettent de choisir un modèle plus grand quand nous en avons besoin.
- Intégration de l’éditeur. La prise en charge de VS Code, JetBrains et du terminal couvre la plupart des flux de travail.
Comparaison rapide
| Application | Meilleur pour | Plan gratuit | Prix de départ | Plateformes |
|---|---|---|---|---|
| whisper.cpp | Transcription Whisper bare-metal n’importe où | Application complète | Gratuit, open source | Windows, macOS, Linux |
| Talon Voice | Codage sans mains avec grammaire réelle | Niveau gratuit | Environ $15/mois Pro (optionnel) | Windows, macOS, Linux |
| Serenade | Commandes vocales dans VS Code | Niveau gratuit | Environ $10/mois Pro | Windows, macOS, Linux |
| Vosk | Petits modèles embarqués | Ensemble d’outils complet | Gratuit, open source | Windows, macOS, Linux |
| WhisperKit | Whisper natif Apple Silicon | Framework complet | Gratuit, open source | macOS |
| Wispr Flow | Dictée à l’échelle du système avec finesse | Essai de 7 jours | Environ $12/mois | macOS, Windows |
| SuperWhisper | Whisper barre de menu hors ligne sur macOS | Niveau gratuit | Environ $9 une fois ou niveau à vie | macOS |
Les applications
1. whisper.cpp — Meilleure transcription bare-metal hors ligne
whisper.cpp est le port C++ de Whisper d’OpenAI par Georgi Gerganov. Il s’exécute sur CPU, sur Apple Silicon via Metal, et sur les GPU Nvidia via CUDA. La transcription en continu en temps réel fonctionne avec les modèles small.en ou medium.en sur n’importe quel ordinateur portable de ces cinq dernières années. L’ensemble du runtime est un seul binaire ; Python n’est pas nécessaire.
Où cela échoue : c’est une bibliothèque, pas une GUI. Obtenir du texte dans une application cible signifie utiliser un script qui dirige vers wl-copy, xdotool ou AppleScript.
Tarification :
- Gratuit : Code source complet, licence MIT
- Payant : Aucun
Plateformes : Windows, macOS, Linux
Télécharger : whisper.cpp sur GitHub
Conclusion : Chaque outil de dictée hors ligne de cette liste utilise whisper.cpp sous le capot ou concurrence avec lui. Commencez ici.
2. Talon Voice — Meilleur codage sans mains
Talon Voice est ce que les développeurs atteints du syndrome du canal carpien à long terme utilisent pour écrire du code entièrement par la voix. Le système de grammaire comprend camelCase, snake_case, SCREAMING_SNAKE et tous les mouvements d’éditeur que nous pourrions demander. Talon s’exécute hors ligne par défaut avec son propre moteur de reconnaissance vocale (modèles Conformer, pas Whisper).
Où cela échoue : la courbe d’apprentissage est réelle. L’écriture de grammaires personnalisées nécessite un après-midi avant que l’application ne soit rentable. Les packs de langue maintenus par la communauté (talon-community) sont essentiels.
Tarification :
- Gratuit : Application complète pour usage personnel
- Payant : Un niveau de soutien d’environ $15/mois déverrouille un modèle plus grand et des mises à jour prioritaires (optionnel)
Plateformes : Windows, macOS, Linux
Télécharger : Téléchargements Talon Voice
Conclusion : L’étalon-or pour le codage sans mains. Si nous tapons pour vivre, Talon vaut la semaine de configuration.
3. Serenade — Meilleure édition contrôlée par la voix dans VS Code
Serenade se trouve à l’intérieur de VS Code, des IDE JetBrains et des terminaux, écoute les commandes structurées (“add function foo taking user”), et produit le code correspondant. Exécute un modèle de reconnaissance vocale local sur du matériel moderne.
Où cela échoue : le niveau gratuit limite les minutes de voix quotidiennes. La grammaire des commandes est plus stricte que celle de Talon ; la dictée de forme libre n’est pas son point fort.
Tarification :
- Gratuit : Minutes de voix quotidiennes limitées
- Payant : Pro environ $10/mois
Plateformes : Windows, macOS, Linux
Télécharger : Téléchargements Serenade
Conclusion : Pour une édition vocale légère dans un IDE grand public, Serenade nécessite moins de configuration que Talon.
4. Vosk — Meilleur petit kit d’outils de reconnaissance vocale hors ligne
Vosk est le kit d’outils de reconnaissance vocale d’Alpha Cephei. Les modèles commencent à 50 Mo (plus petit que le modèle petit de whisper.cpp) et s’exécutent sur le matériel Raspberry Pi. Liaisons natives pour Python, Node, C#, Java et Go.
Où cela échoue : la précision est inférieure aux modèles de classe Whisper en anglais général. Mieux adapté aux grammaires de commande, aux mots d’activation et aux vocabulaires limités.
Tarification :
- Gratuit : Kit d’outils complet et modèles par défaut (Apache 2.0)
- Payant : Aucun
Plateformes : Windows, macOS, Linux, Android, iOS
Télécharger : Téléchargements Vosk
Conclusion : Pas le choix pour la dictée gratuite. Excellent pour scripter un mot d’activation ou une grammaire de commande stricte dans une application existante.
5. WhisperKit — Meilleure pile Whisper Apple Silicon
WhisperKit est le package Swift d’Argmax qui exécute Whisper sur le Neural Engine d’Apple. Sur un Mac de la série M, medium.en se transcrit à 30 à 60 fois en temps réel en utilisant des watts en un seul chiffre.
Où cela échoue : macOS uniquement. La construction sur celui-ci signifie écrire Swift.
Tarification :
- Gratuit : Code source complet, MIT
- Payant : Aucun
Plateformes : macOS, iOS
Télécharger : WhisperKit sur GitHub
Conclusion : La bibliothèque que chaque application de dictée Mac sérieuse utilise maintenant. Pas quelque chose que nous installons directement, mais la raison pour laquelle SuperWhisper et Wispr Flow se sentent instantanés sur Apple Silicon.
6. Wispr Flow — Meilleure dictée à l’échelle du système avec finesse
Wispr Flow est la chose la plus proche d’une expérience “parlez simplement dans n’importe quel champ de texte”. Déclenchez avec une touche d’accès rapide, parlez, relâchez, et le texte transcrit est inséré où se trouve le curseur. La ponctuation, la capitalisation et le formatage compatible avec le code se produisent tous sur l’appareil.
Où cela échoue : payant après l’essai. macOS est la version mature ; Windows rattrap toujours les options de modèle et les contrôles de barre de menu.
Tarification :
- Gratuit : Essai de 7 jours
- Payant : Environ $12/mois
Plateformes : macOS, Windows
Télécharger : Site officiel de Wispr Flow
Conclusion : Si la dictée doit sembler faire partie du système d’exploitation, c’est l’option payante avec le moins de friction.
7. SuperWhisper — Meilleur Whisper barre de menu hors ligne sur macOS
SuperWhisper est une application de barre de menu autonome qui exécute Whisper localement, transcrit dans n’importe quel champ de texte actif, et peut post-traiter la sortie avec un LLM sur appareil (Ollama, LM Studio ou modèles sur appareil d’Apple).
Où cela échoue : macOS uniquement. Le prix unique serait modeste pour une application exclusivement Mac, mais le niveau de mise à niveau “à vie” existe toujours et vaut le prix pour les utilisateurs quotidiens.
Tarification :
- Gratuit : Niveau de base avec modèles par défaut
- Payant : Environ $9 une fois ou niveau à vie pour un catalogue de modèle plus large
Plateformes : macOS
Télécharger : Site officiel de SuperWhisper
Conclusion : Les utilisateurs de Mac qui veulent une dictée hors ligne sans tuyauterie de pipeline : installez-le en cinq minutes et sautez le reste de la liste.
Comment choisir le bon
- Nous voulons la meilleure option gratuite, multiplateforme : whisper.cpp, piloté par un petit script de wrapper.
- Nous écrivons du code entièrement par la voix : Talon Voice.
- Nous voulons des commandes vocales spécifiquement à l’intérieur de VS Code : Serenade.
- Nous utilisons un Mac et voulons zéro configuration : SuperWhisper ou Wispr Flow.
- Nous intégrons la parole dans une application existante : Vosk (petite empreinte) ou WhisperKit (Apple Silicon).
FAQ
La reconnaissance vocale hors ligne est-elle vraiment aussi bonne que la dictée cloud ? Pour l’anglais, whisper-large-v3 s’exécutant localement est à quelques cheveux près de ce que les services de dictée cloud retournent. Les langues non anglaises traînent toujours derrière les offres cloud, mais l’écart continue de se réduire à chaque sortie de modèle.
Puis-je exécuter ceci sur un CPU sans GPU ? Oui. whisper.cpp, Vosk, Talon et Serenade s’exécutent tous sur CPU. Whisper-medium s’exécute à la vitesse en temps réel sur n’importe quel CPU d’ordinateur portable moderne.
Quelle est la différence entre Whisper et Vosk ? Whisper est un grand modèle basé sur un transformateur entraîné sur l’audio multilingue ; la précision est élevée, les modèles sont plus lourds. Vosk utilise de plus petits modèles optimisés pour la diffusion en continu ; la précision est inférieure pour la dictée générale mais la latence et l’empreinte sont meilleures pour l’utilisation intégrée.
Certains d’entre eux conservent-ils l’audio sur l’appareil à jamais ? Oui. whisper.cpp, Vosk, WhisperKit, Talon (dans sa configuration par défaut) et SuperWhisper sont tous hors ligne. Serenade et Wispr Flow utilisent par défaut les modèles sur appareil mais vérifiez les paramètres si nous traitons l’audio sensible.
La dictée est-elle plus rapide que la dactylographie ? Pour la prose, oui, une fois que nous nous adaptons. Pour le code, cela s’aligne avec la dactylographie tactile après quelques heures de pratique avec Talon ou Serenade. Le plus grand avantage est de pouvoir travailler à travers une blessure au poignet sans perdre la journée.