Personne n’a besoin d’une carte 24 Go pour exécuter un modèle local utile en 2026. Les modèles quantifiés de 7 à 14 milliards de paramètres tiennent dans 8 à 12 Go de VRAM aux vitesses qu’une GTX 1080 ou RTX 2080 d’occasion produit confortablement, et la différence entre « cloud uniquement » et « local la plupart du temps » est maintenant une installation de pilote et un téléchargement de 4 Go. L’astuce est le runtime. Certaines applications supposent une carte RTX 50-series toute neuve ; d’autres ont été construites spécifiquement pour le matériel ancien assis dans un châssis de serveur domestique.
Nous avons testé 8 applications de bureau pour exécuter l’IA locale sur les anciennes GPU NVIDIA, en nous concentrant sur Pascal (série GTX 10 et Quadro P), Turing (série RTX 20 et Quadro T) et Ampere précoce (série RTX 30 et stations de travail série A). Chaque application de la liste exécute Llama 3.1, Qwen 2.5, Mistral 7B ou Gemma 2 sur 8 Go de VRAM avec un taux de jetons par seconde utilisable. Celle qui correspond à notre configuration dépend de si nous voulons une fenêtre de chat, un service ou un runtime de bas niveau.
Quoi chercher dans une application d’IA locale pour les anciennes GPU
Les contraintes matérielles importent plus que le texte marketing.
- Prise en charge de CUDA 11, pas seulement CUDA 12 (Pascal plafond à CUDA 12.6 sur Linux, plus tard sur Windows).
- Formats de quantification qui font tenir 7B dans 8 Go (GGUF Q4_K_M, Q5_K_M ou AWQ 4-bit).
- Déchargement de couches afin qu’un modèle 13B puisse décharger les couches en excès sur CPU sans devenir inutile.
- Une installation en un clic qui ne nécessite pas de compiler PyTorch à partir des sources.
- Une API compatible avec OpenAI afin que tout client puisse pointer sur localhost sans shim personnalisé.
- Téléchargement de modèle qui reprend et vérifie les sommes de contrôle (la paranoïa de l’ère du dial-up aide toujours).
Comparaison rapide
| Application | Meilleur pour | Windows / Linux | Plan gratuit | Caractéristique remarquable | Licence |
|---|---|---|---|---|---|
| Ollama | Démon headless et scripts | Les deux | Gratuit | Extraction de modèle en une ligne, orientée CLI | MIT |
| LM Studio | Chat tout en un | Les deux | Gratuit | Navigateur de modèles + chat + serveur | Propriétaire |
| KoboldCPP | Runtime exécutable unique | Les deux | Gratuit | Pas d’installation, GGUF, TTS, images | AGPL 3.0 |
| text-generation-webui | Bidouillage utilisateur avancé | Les deux | Gratuit | Tous les formats de quantification pris en charge | AGPL 3.0 |
| GPT4All | Premier modèle sur un ordinateur portable modeste | Les deux | Gratuit | Barre latérale LocalDocs, présets VRAM faible | Type MIT |
| Jan | Équivalent LM Studio entièrement open-source | Les deux | Gratuit | Prise en charge MCP, compatible OpenAI | Apache 2.0 |
| llama.cpp | Vitesse métal nu | Les deux | Gratuit | CPU plus rapide + déchargement GPU partiel | MIT |
| vLLM | Serveur API multi-utilisateur | Linux (WSL sur Windows) | Gratuit | Attention paginée, meilleur débit | Apache 2.0 |
Les applications
1. Ollama – meilleur démon headless sur les anciennes cartes NVIDIA
Ollama est le runtime que la plupart des gens installent en premier car le flux de travail entier est ollama pull llama3.1:8b puis ollama run llama3.1. Sur une GTX 1080 Ti (11 Go), Llama 3.1 8B Q4_K_M s’exécute à 25 à 30 jetons par seconde ; sur une RTX 2080 Super (8 Go), le même modèle tourne à environ 40. Ollama lie un point de terminaison compatible avec OpenAI sur localhost:11434, et n’importe quel frontend parlant OpenAI (Open WebUI, Msty, LibreChat) se branche avec un changement d’URL de base.
Où il échoue: Le client de chat est un terminal. Ollama n’est pas livré avec une GUI ; l’utilisation graphique signifie ajouter Open WebUI ou un autre frontend.
Tarification:
- Gratuit: Tout, sous licence MIT
- Payant: Aucun
Plates-formes: Windows, macOS, Linux
Télécharger: ollama.com
Résumé: Le bon choix quand l’objectif est de servir un modèle à d’autres outils et scripts, pas discuter dans une application.
2. LM Studio – meilleur tout en un pour une première installation
LM Studio est l’option « télécharger un EXE et parler à un modèle en cinq minutes ». L’application regroupe un navigateur Hugging Face, un volet de chat et un bouton pour exposer un serveur compatible avec OpenAI sur localhost:1234. La détection VRAM est précise sur les anciennes cartes, et la liste des modèles indique quelles versions correspondent entièrement sur notre GPU par rapport à celles qui nécessitent un déchargement CPU.
Où il échoue: Le client est un code fermé. L’utilisation commerciale nécessite de remplir le formulaire de licence de l’équipe LM Studio et d’attendre un devis.
Tarification:
- Gratuit: Utilisation personnelle
- Payant: Licence d’équipe sur demande
Plates-formes: Windows, macOS, Linux
Télécharger: lmstudio.ai
Résumé: L’installation première la plus conviviale sur les anciennes GPU NVIDIA, avec le chemin le plus rapide vers une fenêtre de chat fonctionnelle.
3. KoboldCPP – meilleur runtime sans installation
KoboldCPP est un exécutable unique (koboldcpp.exe sur Windows, un binaire statique sur Linux) qui exécute les modèles GGUF, la génération d’images Stable Diffusion et la transcription Whisper sans aucun environnement Python. Sur une GTX 1660 Super (6 Go), un modèle 7B Q4 tient toujours avec quelques couches déchargées sur CPU, et le même exécutable gère la génération d’images rapide sans changer d’application.
Où il échoue: L’interface utilisateur est basée sur le web (s’ouvre dans un onglet de navigateur) et se sent fonctionnelle plutôt que soignée. La profondeur des fonctionnalités est élevée, la découverte est faible.
Tarification:
- Gratuit: Tout, AGPL 3.0
- Payant: Aucun
Plates-formes: Windows, macOS, Linux
Télécharger: github.com/LostRuins/koboldcpp
Résumé: Le choix quand la machine cible est un ordinateur portable, un homelab ou un PC d’ami où nous ne voulons pas installer Python à l’échelle du système.
4. text-generation-webui – meilleur pour les utilisateurs avancés
text-generation-webui (oobabooga) prend en charge tous les formats de quantification qui importent (GGUF, GPTQ, AWQ, exllamav2), nous permet de changer de chargeurs à la volée et expose les commandes de génération de bas niveau (mise à l’échelle rope, mirostat, température dynamique) que d’autres applications cachent. Sur une RTX 3060 (12 Go), elle exécute joyeusement un modèle 14B en Q4 à 20 à 30 jetons par seconde.
Où il échoue: L’installateur récupère plusieurs gigaoctets de dépendances Python. Le premier lancement prend 5 à 10 minutes. Pas l’outil pour quelqu’un qui veut cliquer sur une chose et discuter.
Tarification:
- Gratuit: Tout, AGPL 3.0
- Payant: Aucun
Plates-formes: Windows, macOS, Linux
Télécharger: github.com/oobabooga/text-generation-webui
Résumé: Idéal pour l’utilisateur qui souhaite comparer les quantifications de modèles et les stratégies de génération sur le même matériel.
5. GPT4All – meilleur point de départ VRAM faible
GPT4All a le seuil le plus bas : le catalogue de modèles intégré signale les modèles 3B et 4B qui s’exécutent sur les cartes 4 Go, et la barre latérale LocalDocs gère les petits travaux RAG sans une base de données vectorielle distincte. Sur une GTX 1060 (6 Go), Mistral 7B Instruct s’exécute à un taux utilisable de 15 à 20 jetons par seconde.
Où il échoue: L’interface utilisateur est conçue pour un usage individuel ; il n’y a pas d’API multi-utilisateur intégrée. Le catalogue des modèles est plus petit que celui de LM Studio ou Ollama.
Tarification:
- Gratuit: Tout
- Payant: Aucun ; le support entreprise est un module complémentaire payant
Plates-formes: Windows, macOS, Linux
Télécharger: gpt4all.io
Résumé: La première installation appropriée sur un ordinateur portable avec 4 à 6 Go de VRAM.
6. Jan – meilleur équivalent LM Studio entièrement open-source
Jan est ce à quoi ressemblerait LM Studio si le client lui-même était Apache 2.0. Catalogue de modèles propriétaire, serveur compatible OpenAI sur localhost:1337, prise en charge du Model Context Protocol afin que Claude Desktop et Continue puissent accéder à un modèle hébergé sur Jan, et sans télémétrie.
Où il échoue: Projet plus jeune que LM Studio ; le catalogue est plus petit et certaines quantifications Hugging Face arrivent plus tard. L’accélération GPU Windows sur le matériel non CUDA rattrape encore son retard.
Tarification:
- Gratuit: Tout, Apache 2.0
- Payant: Aucun
Plates-formes: Windows, macOS, Linux
Télécharger: jan.ai
Résumé: Le choix open-source quand nous voulons une application de style LM Studio dont nous pouvons lire la licence en une après-midi.
7. llama.cpp – meilleur runtime métal nu
llama.cpp est le projet C++ sur lequel le reste de l’écosystème est construit. Il s’exécute partout, se compile en cinq minutes sur Linux et produit le meilleur débit utilisateur unique sur les anciennes GPU car il n’y a pas d’abstraction Python entre le pilote et le modèle. Sur une GTX 1080 Ti avec -ngl 33, elle atteint les taux de jetons bruts que les applications de niveau supérieur traînent de quelques pour cent.
Où il échoue: Pas d’installateur, pas d’interface graphique. Nous compilons et exécutons des outils en ligne de commande. La configuration initiale pour un utilisateur Windows nécessite plus de travail que n’importe quelle autre application de cette liste.
Tarification:
- Gratuit: Tout, MIT
- Payant: Aucun
Plates-formes: Windows, macOS, Linux
Télécharger: github.com/ggml-org/llama.cpp
Résumé: Pour les développeurs qui veulent savoir exactement ce qui se passe entre le fichier modèle et le premier jeton.
8. vLLM – meilleur serveur API multi-utilisateur sur Linux
vLLM est le runtime pour transformer une ancienne station de travail en petit serveur d’inférence d’équipe. L’attention paginée met à l’échelle le débit presque linéairement avec les requêtes concurrentes, et les modèles quantifiés AWQ 4-bit permettent à une carte 24 Go de servir deux ou trois personnes tapant simultanément sans rester bloqué. S’exécute nativement sur Linux ; les utilisateurs Windows ont besoin de WSL 2 avec la transmission CUDA.
Où il échoue: Pas une application de chat. vLLM est un serveur compatible OpenAI et s’attend à ce que les clients le frappent. La prise en charge des petits modèles est bonne, mais l’accent d’optimisation du projet est sur les déploiements plus importants.
Tarification:
- Gratuit: Tout, Apache 2.0
- Payant: Aucun
Plates-formes: Linux (WSL sur Windows)
Télécharger: github.com/vllm-project/vllm
Résumé: Le choix quand l’objectif est un clone OpenAI privé qu’une petite équipe partage.
Comment choisir le bon
- Si nous voulons une fenêtre de chat dans les 10 prochaines minutes: LM Studio ou GPT4All.
- Si nous servons des modèles à d’autres outils: Ollama.
- Si nous voulons la même expérience open-source: Jan.
- Si notre machine ne peut rien installer à l’échelle du système: KoboldCPP.
- Si nous voulons presser les derniers pour cent de performances: llama.cpp.
- Si nous voulons comparer les versions et quantifications de modèles: text-generation-webui.
- Si une petite équipe va partager la machine: vLLM sur Linux.
FAQ
À quel point une GPU est-elle trop vieille pour exécuter l’IA locale?
Les cartes avec 4 Go de VRAM et Compute Capability 6.0 ou supérieur (Pascal et plus tard) peuvent exécuter les modèles 3B et 4B confortablement. En dessous de 4 Go, la réponse pratique est l’inférence CPU uniquement avec un petit modèle.
GTX 1080 Ti a-t-elle encore du sens en 2026?
Oui pour l’IA locale. Elle dispose de 11 Go de VRAM, d’une large prise en charge CUDA 12 et de suffisamment de calculs pour les modèles 7B et 8B à 25 à 30 jetons par seconde. Pas assez pour la génération d’images haute résolution.
Quel format de quantification est le meilleur pour les anciennes cartes?
GGUF Q4_K_M ou Q5_K_M pour la qualité de chat, AWQ 4-bit pour le meilleur débit lors de l’utilisation de vLLM. GPTQ fonctionne toujours, mais le format est tranquillement supprimé.
Puis-je exécuter ces applications sur les GPU AMD ou Intel?
Ollama, LM Studio, KoboldCPP et llama.cpp prennent en charge Vulkan ou ROCm sur de nombreuses cartes AMD. Intel Arc est pris en charge via SYCL dans llama.cpp et OpenVINO dans certaines fourches. Cet article se concentre sur NVIDIA car c’est là que la conversation sur les cartes anciennes se déroule.
Dois-je m’inquiéter de la télémétrie?
Ollama, KoboldCPP, Jan, llama.cpp, GPT4All et vLLM sont livrés sans télémétrie. LM Studio a les bascules de télémétrie dans les paramètres ; désactiver au premier lancement.