L’écart entre les modèles hébergés et les modèles locaux sur un GPU décent s’est suffisamment réduit pour que les tâches de codage se terminent maintenant sans ouvrir Claude. Qwen 3, Llama 3.3 et DeepSeek-Coder s’exécutent de manière réactive sur une carte 16 Go et gèrent les refactorisations, les tests et les petites fonctionnalités. Ce qui manquait, c’était les outils : les modèles locaux allaient bien, les applications autour d’eux ne l’étaient pas. Cela a changé au cours des douze derniers mois. Voici les sept applications de bureau que nous avons testées par rapport à des référentiels réels, classées en fonction de celles que nous avions toujours installées une semaine plus tard.
Que rechercher dans une application de codage LLM locale
Tous les outils d’« IA locale » ne conviennent pas au travail de codage. Un choix sérieux devrait couvrir la plupart de ceux-ci :
- Exécute les modèles sur votre machine ou LAN, ne route jamais les prompts vers une API hébergée par défaut.
- Comprend un projet, pas seulement des fichiers individuels : contexte dans tout le référentiel, références de fichiers et diffs.
- Fonctionne dans un éditeur ou est livré avec le sien, pour que les complétions et les refactorisations atterrissent là où vous écrivez.
- Diffuse les appels d’outils comme le font les outils agentic (lire un fichier, éditer un fichier, exécuter une commande).
- Gère au moins les modèles 7B et 14B sans tomber en panne sur un GPU 16 Go.
- Est livré avec une API compatible OpenAI pour que vous puissiez pointer d’autres outils vers le même runtime.
Tout ce qui suit répond à quatre conditions ou plus. Les meilleurs choix satisfont aux six.
Comparaison rapide
| Application | Meilleur pour | Plateformes | Local | Prix de départ/mois | Évaluation |
|---|---|---|---|---|---|
| Continue.dev | Extension d’éditeur pour modèles locaux | Win/Mac/Linux | Oui | Gratuit | 4.6 |
| Ollama | Runtime de modèle local rapide | Win/Mac/Linux | Oui | Gratuit | 4.7 |
| LM Studio | Interface graphique pour parcourir et exécuter les modèles | Win/Mac/Linux | Oui | Gratuit | 4.5 |
| Aider | Programmation en binôme CLI | Win/Mac/Linux | Oui | Gratuit | 4.5 |
| Cursor | IDE agentic avec routage local | Win/Mac/Linux | Optionnel | $20 | 4.6 |
| Cline | Agent de codage autonome | VS Code + Ollama | Oui | Gratuit | 4.4 |
| Tabby | Copilot auto-hébergé | Win/Mac/Linux | Oui | Gratuit | 4.3 |
Les applications
1. Continue.dev, la meilleure extension d’éditeur pour les modèles locaux
Continue.dev est une extension VS Code et JetBrains qui communique avec n’importe quel point de terminaison compatible OpenAI. Pointez-la vers Ollama ou LM Studio s’exécutant localement et vous obtenez le chat, l’édition et l’autocomplétion dans l’éditeur. Le config.json vous permet d’assigner des modèles différents à des rôles différents : un petit modèle rapide pour l’autocomplétion, un plus grand pour les refactorisations, un spécialiste pour les plongements.
Où il est en retrait : La latence d’autocomplétion sur très petits GPU s’avère. Le système de règles et de contexte est puissant mais la documentation suppose que vous savez pourquoi vous voulez un fichier d’invite système par projet. Pas d’application de bureau native ; la valeur est dans votre éditeur.
Tarification :
- Gratuit : extension, utilisation illimitée avec vos propres modèles
- Payant : aucun
Plateformes : VS Code et JetBrains sur Windows, macOS, Linux
Télécharger : Continue.dev extension
Conclusion : Le meilleur choix pour rester dans votre éditeur avec un modèle local faisant le travail lourd.
2. Ollama, le meilleur runtime de modèle local
Ollama est le runtime que la plupart des autres applications de cette liste finissent par utiliser. Il exécute Llama, Qwen, DeepSeek, Mistral et des dizaines d’autres avec une commande ollama run <model>, expose une API compatible OpenAI sur le port 11434 et gère les téléchargements de modèles, les variantes de quantification et les mises à jour. Les applications de bureau pour Windows, macOS et Linux installent un démon de plateau système.
Où il est en retrait : L’interface utilisateur est minimaliste par conception. Vous avez besoin d’un frontend séparé (Continue, LM Studio, Open WebUI) si vous voulez une fenêtre de chat. La gestion des modèles est CLI-first et mieux via des scripts.
Tarification :
- Gratuit : runtime complet, tous les modèles
- Payant : aucun
Plateformes : Windows, macOS, Linux
Télécharger : Ollama for desktop
Conclusion : Le meilleur choix en tant que moteur derrière chaque autre outil de cette liste.
3. LM Studio, la meilleure interface graphique pour parcourir et exécuter des modèles
LM Studio offre tout ce qu’Ollama a plus une interface graphique : un navigateur de modèles de style Hugging Face, une fenêtre de chat et des contrôles pour le déchargement GPU, la longueur du contexte et les invites du système. Il expose également une API compatible OpenAI sur 1234 pour que Continue, Cursor et Aider puissent communiquer avec elle.
Où il est en retrait : L’empreinte mémoire est plus grande qu’Ollama. Le catalogue de modèles est conservé, donc les versions de pointe prennent parfois un jour pour apparaître. La licence non commerciale au niveau gratuit est un facteur si vous expédiez un produit.
Tarification :
- Gratuit : usage personnel, toutes les fonctionnalités
- Payant : LM Studio for Work à tarif personnalisé pour usage commercial
Plateformes : Windows, macOS, Linux
Télécharger : LM Studio for desktop
Conclusion : Le meilleur choix si vous voulez une interface graphique pour comparer les modèles avant de vous engager.
4. Aider, le meilleur binômage de programmation CLI
Aider est une application de terminal qui traite votre référentiel comme l’espace de travail partagé. Vous décrivez un changement, Aider détermine quels fichiers toucher, les édite, exécute les tests que vous lui dites, et commit avec un message. Il fonctionne avec n’importe quel point de terminaison compatible OpenAI, donc Ollama ou LM Studio l’alimentent localement.
Où il est en retrait : CLI uniquement, donc pas d’autocomplétion dans votre éditeur. Nécessite un référentiel git propre pour que sa boucle édition-et-commit soit sûre. Plus lent sur très grands référentiels où l’heuristique de sélection de fichiers a plus de choses à passer au crible.
Tarification :
- Gratuit : application complète, toutes les fonctionnalités
- Payant : aucun
Plateformes : Windows, macOS, Linux (paquet Python)
Télécharger : Aider on GitHub
Conclusion : Le meilleur choix lorsque vous préférez décrire un changement en mots plutôt que de cliquer à travers l’interface.
5. Cursor, la meilleure IDE agentic avec routage local
Cursor est un fork de VS Code axé sur les flux de travail centrés sur l’IA. Le mode Agent planifie, édite et teste dans tout le référentiel. Vous pouvez router Cursor vers Ollama ou n’importe quel point de terminaison local via le paramètre « Override OpenAI Base URL », en gardant les prompts sur votre machine tout en utilisant l’interface agentic de Cursor.
Où il est en retrait : Le niveau payant est l’endroit où vivent la plupart des fonctionnalités de Cursor ; le niveau gratuit limite les complétions et les exécutions d’agents. Le routage de modèles locaux est officiellement « avancé », ce qui signifie que la configuration est documentée mais pas par défaut.
Tarification :
- Gratuit : 2000 complétions/mois, agent limité
- Payant : Pro à 20 $/mois pour les complétions illimitées, Business à 40 $/utilisateur/mois
Plateformes : Windows, macOS, Linux
Télécharger : Cursor for desktop
Conclusion : Le meilleur choix si vous voulez une IDE agentic et êtes disposé à la configurer pour communiquer avec un modèle local.
6. Cline, le meilleur agent de codage autonome dans VS Code
Cline est une extension VS Code qui exécute un agent de codage étape par étape dans l’éditeur. Il lit les fichiers, écrit les éditions, exécute les commandes de terminal et les rapports, le tout depuis un panneau de chat qui affiche chaque action avant de l’appliquer. Cline fonctionne avec n’importe quel point de terminaison compatible OpenAI, donc Ollama sur la même machine garde la boucle entièrement locale.
Où il est en retrait : Les modèles locaux plus lents que 30 jetons/sec rendent la boucle étape par étape lente. Le mode approuver-chaque-action est le comportement par défaut, ce qui est plus sûr mais ajoute de la friction. Certains outils fonctionnent mieux avec les modèles frontaliers hébergés qu’avec les 14B locaux.
Tarification :
- Gratuit : extension, utilisation illimitée avec vos propres modèles
- Payant : aucun
Plateformes : VS Code sur Windows, macOS, Linux
Télécharger : Cline extension
Conclusion : Le meilleur choix lorsque vous voulez une véritable boucle d’agent sans abandonner le contrôle de la clé API.
7. Tabby, le meilleur Copilot auto-hébergé
Tabby est une alternative auto-hébergée à GitHub Copilot. Il exécute un serveur qui utilise le protocole Copilot, donc n’importe quel éditeur avec support Copilot (VS Code, JetBrains, Neovim) peut le pointer. L’image Docker est le chemin le plus rapide vers une configuration fonctionnelle ; l’application de bureau sur Windows, macOS et Linux exécute le même serveur derrière une interface graphique.
Où il est en retrait : Le modèle de complétion est correct mais non au niveau des modèles propriétaires de Copilot. Les fonctionnalités d’équipe (analyses, politiques) vivent au niveau payant. RAG sur votre codebase est disponible mais nécessite du tuning.
Tarification :
- Gratuit : utilisateur unique, complétions illimitées
- Payant : Plan d’équipe à 19 $/utilisateur/mois pour les analyses et SSO
Plateformes : Windows, macOS, Linux (serveur + plugins d’éditeur)
Télécharger : Tabby for desktop
Conclusion : Le meilleur choix si vous voulez un remplacement Copilot clé en main que votre équipe peut exécuter sur son propre matériel.
Comment choisir le bon
- Si vous voulez le point de départ le plus simple : Ollama plus Continue.dev dans VS Code.
- Si vous voulez une fenêtre de chat pendant que vous comparez les modèles : LM Studio.
- Si vous préférez décrire les changements plutôt que de cliquer à travers eux : Aider.
- Si vous voulez l’expérience d’agent polie sans verrouillage d’hébergement : Cursor pointé vers un point de terminaison local, ou Cline pour une boucle entièrement locale.
- Si vous avez besoin de Copilot pour une petite équipe sur votre propre matériel : Tabby.
- Si vous avez essayé un outil de codage hébergé et cela a cassé votre budget : N’importe lequel des quatre choix gratuits. Un 4090 se paie contre un plan d’entreprise à 200 $/mois en quelques mois.
FAQ
Quelle est la meilleure application LLM locale gratuite pour le codage ?
Continue.dev dans votre éditeur, alimenté par Ollama en arrière-plan, est la pile gratuite la plus productive. Aider est l’option CLI-first la plus forte. Cline est la meilleure boucle d’agent gratuite.
Ces applications gardent-elles vraiment mon code privé ?
Oui lorsqu’elles sont configurées contre un point de terminaison local. Ollama, LM Studio et Tabby exécutent tous les modèles sur votre machine ou LAN. Les wrappers (Continue, Aider, Cline, Cursor) envoient des prompts à n’importe quelle URL que vous définissez, donc pointer vers localhost garde tout local. Cursor envoie les prompts à ses propres serveurs par défaut ; la substitution du point de terminaison local est ce qui le change.
Quel GPU ai-je besoin pour exécuter un modèle de codage localement ?
Une carte 16 Go exécute les modèles 14B à des vitesses utilisables et les modèles 34B avec quantification lourde. Une carte 24 Go exécute confortablement un modèle 34B complet sur 4-bit. Sur CPU uniquement, les modèles 7B fonctionnent mais assez lentement pour que la boucle se sente frustrante pour tout au-delà de l’autocomplétion.
Puis-je utiliser ces applications avec GitHub Copilot ?
Tabby utilise le protocole Copilot et fonctionne comme un remplacement. Les autres s’exécutent aux côtés de Copilot plutôt que de le remplacer. Continue et Cline fonctionnent bien tous les deux avec Copilot activé dans le même éditeur.
Quel est le meilleur modèle local pour le codage en ce moment ?
Pour le codage général, Qwen 3 Coder 30B et DeepSeek-Coder-V2 16B sont les choix les plus forts qui correspondent à une carte 24 Go. Pour une carte 16 Go, Qwen 3 Coder 14B et Codestral 22B (Q4) atteignent le point idéal. Les quatre s’exécutent dans Ollama et LM Studio hors de la boîte.