Les meilleures applications pour exécuter l'IA locale sur les anciennes GPU NVIDIA

Personne n’a besoin d’une carte 24 Go pour exécuter un modèle local utile en 2026. Les modèles quantifiés de 7 à 14 milliards de paramètres tiennent dans 8 à 12 Go de VRAM aux vitesses qu’une GTX 1080 ou RTX 2080 d’occasion produit confortablement, et la différence entre « cloud uniquement » et « local la plupart du temps » est maintenant une installation de pilote et un téléchargement de 4 Go. L’astuce est le runtime. Certaines applications supposent une carte RTX 50-series toute neuve ; d’autres ont été construites spécifiquement pour le matériel ancien assis dans un châssis de serveur domestique.

Nous avons testé 8 applications de bureau pour exécuter l’IA locale sur les anciennes GPU NVIDIA, en nous concentrant sur Pascal (série GTX 10 et Quadro P), Turing (série RTX 20 et Quadro T) et Ampere précoce (série RTX 30 et stations de travail série A). Chaque application de la liste exécute Llama 3.1, Qwen 2.5, Mistral 7B ou Gemma 2 sur 8 Go de VRAM avec un taux de jetons par seconde utilisable. Celle qui correspond à notre configuration dépend de si nous voulons une fenêtre de chat, un service ou un runtime de bas niveau.

Quoi chercher dans une application d’IA locale pour les anciennes GPU

Les contraintes matérielles importent plus que le texte marketing.

Comparaison rapide

Application Meilleur pour Windows / Linux Plan gratuit Caractéristique remarquable Licence
Ollama Démon headless et scripts Les deux Gratuit Extraction de modèle en une ligne, orientée CLI MIT
LM Studio Chat tout en un Les deux Gratuit Navigateur de modèles + chat + serveur Propriétaire
KoboldCPP Runtime exécutable unique Les deux Gratuit Pas d’installation, GGUF, TTS, images AGPL 3.0
text-generation-webui Bidouillage utilisateur avancé Les deux Gratuit Tous les formats de quantification pris en charge AGPL 3.0
GPT4All Premier modèle sur un ordinateur portable modeste Les deux Gratuit Barre latérale LocalDocs, présets VRAM faible Type MIT
Jan Équivalent LM Studio entièrement open-source Les deux Gratuit Prise en charge MCP, compatible OpenAI Apache 2.0
llama.cpp Vitesse métal nu Les deux Gratuit CPU plus rapide + déchargement GPU partiel MIT
vLLM Serveur API multi-utilisateur Linux (WSL sur Windows) Gratuit Attention paginée, meilleur débit Apache 2.0

Les applications

1. Ollama – meilleur démon headless sur les anciennes cartes NVIDIA

Ollama est le runtime que la plupart des gens installent en premier car le flux de travail entier est ollama pull llama3.1:8b puis ollama run llama3.1. Sur une GTX 1080 Ti (11 Go), Llama 3.1 8B Q4_K_M s’exécute à 25 à 30 jetons par seconde ; sur une RTX 2080 Super (8 Go), le même modèle tourne à environ 40. Ollama lie un point de terminaison compatible avec OpenAI sur localhost:11434, et n’importe quel frontend parlant OpenAI (Open WebUI, Msty, LibreChat) se branche avec un changement d’URL de base.

Où il échoue: Le client de chat est un terminal. Ollama n’est pas livré avec une GUI ; l’utilisation graphique signifie ajouter Open WebUI ou un autre frontend.

Tarification:

Plates-formes: Windows, macOS, Linux

Télécharger: ollama.com

Résumé: Le bon choix quand l’objectif est de servir un modèle à d’autres outils et scripts, pas discuter dans une application.

2. LM Studio – meilleur tout en un pour une première installation

LM Studio est l’option « télécharger un EXE et parler à un modèle en cinq minutes ». L’application regroupe un navigateur Hugging Face, un volet de chat et un bouton pour exposer un serveur compatible avec OpenAI sur localhost:1234. La détection VRAM est précise sur les anciennes cartes, et la liste des modèles indique quelles versions correspondent entièrement sur notre GPU par rapport à celles qui nécessitent un déchargement CPU.

Où il échoue: Le client est un code fermé. L’utilisation commerciale nécessite de remplir le formulaire de licence de l’équipe LM Studio et d’attendre un devis.

Tarification:

Plates-formes: Windows, macOS, Linux

Télécharger: lmstudio.ai

Résumé: L’installation première la plus conviviale sur les anciennes GPU NVIDIA, avec le chemin le plus rapide vers une fenêtre de chat fonctionnelle.

3. KoboldCPP – meilleur runtime sans installation

KoboldCPP est un exécutable unique (koboldcpp.exe sur Windows, un binaire statique sur Linux) qui exécute les modèles GGUF, la génération d’images Stable Diffusion et la transcription Whisper sans aucun environnement Python. Sur une GTX 1660 Super (6 Go), un modèle 7B Q4 tient toujours avec quelques couches déchargées sur CPU, et le même exécutable gère la génération d’images rapide sans changer d’application.

Où il échoue: L’interface utilisateur est basée sur le web (s’ouvre dans un onglet de navigateur) et se sent fonctionnelle plutôt que soignée. La profondeur des fonctionnalités est élevée, la découverte est faible.

Tarification:

Plates-formes: Windows, macOS, Linux

Télécharger: github.com/LostRuins/koboldcpp

Résumé: Le choix quand la machine cible est un ordinateur portable, un homelab ou un PC d’ami où nous ne voulons pas installer Python à l’échelle du système.

4. text-generation-webui – meilleur pour les utilisateurs avancés

text-generation-webui (oobabooga) prend en charge tous les formats de quantification qui importent (GGUF, GPTQ, AWQ, exllamav2), nous permet de changer de chargeurs à la volée et expose les commandes de génération de bas niveau (mise à l’échelle rope, mirostat, température dynamique) que d’autres applications cachent. Sur une RTX 3060 (12 Go), elle exécute joyeusement un modèle 14B en Q4 à 20 à 30 jetons par seconde.

Où il échoue: L’installateur récupère plusieurs gigaoctets de dépendances Python. Le premier lancement prend 5 à 10 minutes. Pas l’outil pour quelqu’un qui veut cliquer sur une chose et discuter.

Tarification:

Plates-formes: Windows, macOS, Linux

Télécharger: github.com/oobabooga/text-generation-webui

Résumé: Idéal pour l’utilisateur qui souhaite comparer les quantifications de modèles et les stratégies de génération sur le même matériel.

5. GPT4All – meilleur point de départ VRAM faible

GPT4All a le seuil le plus bas : le catalogue de modèles intégré signale les modèles 3B et 4B qui s’exécutent sur les cartes 4 Go, et la barre latérale LocalDocs gère les petits travaux RAG sans une base de données vectorielle distincte. Sur une GTX 1060 (6 Go), Mistral 7B Instruct s’exécute à un taux utilisable de 15 à 20 jetons par seconde.

Où il échoue: L’interface utilisateur est conçue pour un usage individuel ; il n’y a pas d’API multi-utilisateur intégrée. Le catalogue des modèles est plus petit que celui de LM Studio ou Ollama.

Tarification:

Plates-formes: Windows, macOS, Linux

Télécharger: gpt4all.io

Résumé: La première installation appropriée sur un ordinateur portable avec 4 à 6 Go de VRAM.

6. Jan – meilleur équivalent LM Studio entièrement open-source

Jan est ce à quoi ressemblerait LM Studio si le client lui-même était Apache 2.0. Catalogue de modèles propriétaire, serveur compatible OpenAI sur localhost:1337, prise en charge du Model Context Protocol afin que Claude Desktop et Continue puissent accéder à un modèle hébergé sur Jan, et sans télémétrie.

Où il échoue: Projet plus jeune que LM Studio ; le catalogue est plus petit et certaines quantifications Hugging Face arrivent plus tard. L’accélération GPU Windows sur le matériel non CUDA rattrape encore son retard.

Tarification:

Plates-formes: Windows, macOS, Linux

Télécharger: jan.ai

Résumé: Le choix open-source quand nous voulons une application de style LM Studio dont nous pouvons lire la licence en une après-midi.

7. llama.cpp – meilleur runtime métal nu

llama.cpp est le projet C++ sur lequel le reste de l’écosystème est construit. Il s’exécute partout, se compile en cinq minutes sur Linux et produit le meilleur débit utilisateur unique sur les anciennes GPU car il n’y a pas d’abstraction Python entre le pilote et le modèle. Sur une GTX 1080 Ti avec -ngl 33, elle atteint les taux de jetons bruts que les applications de niveau supérieur traînent de quelques pour cent.

Où il échoue: Pas d’installateur, pas d’interface graphique. Nous compilons et exécutons des outils en ligne de commande. La configuration initiale pour un utilisateur Windows nécessite plus de travail que n’importe quelle autre application de cette liste.

Tarification:

Plates-formes: Windows, macOS, Linux

Télécharger: github.com/ggml-org/llama.cpp

Résumé: Pour les développeurs qui veulent savoir exactement ce qui se passe entre le fichier modèle et le premier jeton.

8. vLLM – meilleur serveur API multi-utilisateur sur Linux

vLLM est le runtime pour transformer une ancienne station de travail en petit serveur d’inférence d’équipe. L’attention paginée met à l’échelle le débit presque linéairement avec les requêtes concurrentes, et les modèles quantifiés AWQ 4-bit permettent à une carte 24 Go de servir deux ou trois personnes tapant simultanément sans rester bloqué. S’exécute nativement sur Linux ; les utilisateurs Windows ont besoin de WSL 2 avec la transmission CUDA.

Où il échoue: Pas une application de chat. vLLM est un serveur compatible OpenAI et s’attend à ce que les clients le frappent. La prise en charge des petits modèles est bonne, mais l’accent d’optimisation du projet est sur les déploiements plus importants.

Tarification:

Plates-formes: Linux (WSL sur Windows)

Télécharger: github.com/vllm-project/vllm

Résumé: Le choix quand l’objectif est un clone OpenAI privé qu’une petite équipe partage.

Comment choisir le bon

FAQ

À quel point une GPU est-elle trop vieille pour exécuter l’IA locale?
Les cartes avec 4 Go de VRAM et Compute Capability 6.0 ou supérieur (Pascal et plus tard) peuvent exécuter les modèles 3B et 4B confortablement. En dessous de 4 Go, la réponse pratique est l’inférence CPU uniquement avec un petit modèle.

GTX 1080 Ti a-t-elle encore du sens en 2026?
Oui pour l’IA locale. Elle dispose de 11 Go de VRAM, d’une large prise en charge CUDA 12 et de suffisamment de calculs pour les modèles 7B et 8B à 25 à 30 jetons par seconde. Pas assez pour la génération d’images haute résolution.

Quel format de quantification est le meilleur pour les anciennes cartes?
GGUF Q4_K_M ou Q5_K_M pour la qualité de chat, AWQ 4-bit pour le meilleur débit lors de l’utilisation de vLLM. GPTQ fonctionne toujours, mais le format est tranquillement supprimé.

Puis-je exécuter ces applications sur les GPU AMD ou Intel?
Ollama, LM Studio, KoboldCPP et llama.cpp prennent en charge Vulkan ou ROCm sur de nombreuses cartes AMD. Intel Arc est pris en charge via SYCL dans llama.cpp et OpenVINO dans certaines fourches. Cet article se concentre sur NVIDIA car c’est là que la conversation sur les cartes anciennes se déroule.

Dois-je m’inquiéter de la télémétrie?
Ollama, KoboldCPP, Jan, llama.cpp, GPT4All et vLLM sont livrés sans télémétrie. LM Studio a les bascules de télémétrie dans les paramètres ; désactiver au premier lancement.