
Ce vieux PC gaming qui traîne dans le placard a encore beaucoup de vie devant lui. Une machine de l’ère 2018 avec un Ryzen ou un Intel, 32 GB de RAM et un GPU d’occasion exécutera un modèle 7B à vitesse de conversation et hébergera confortablement un modèle 13B. Pointez les ordinateurs portables de la famille vers lui et vous avez une IA privée, toujours actif qui répond sur le LAN en quelques secondes. Les meilleures applications pour transformer un vieux PC en serveur d’IA local choisissent bien leurs modèles, livrent une API HTTP pour d’autres outils et permettent à la machine de dormir entre les requêtes. Nous avons choisi sept applications qui transforment le matériel vieux de dix ans en un service d’IA utilisable.
Ce qu’il faut rechercher dans une application de serveur d’IA local
Six choses comptent pour l’IA sur du vieux matériel :
- Backend et format.
llama.cpp(GGUF) offre le plus large support ; MLC et ONNX sont les alternatives. - Chemin CPU uniquement. Si l’application fonctionne à une vitesse utilisable sur une machine sans GPU.
- Largeur du support GPU. Nvidia (CUDA), AMD (ROCm), Intel (SYCL) et Apple Silicon (Metal).
- Gestion des demandes simultanées. Si la famille peut faire des requêtes en même temps sans qu’une affame l’autre.
- API compatible avec OpenAI. Si d’autres outils peuvent pointer vers le serveur et penser qu’ils parlent à l’API OpenAI.
- Plafond mémoire. La RAM plus la VRAM détermine quel modèle s’adapte. La quantification Q4 réduit de moitié environ le besoin en mémoire.
Comparaison rapide
| Application | Meilleur pour | Support GPU | API | Particularité |
|---|---|---|---|---|
| Ollama | Serveur le plus simple | Nvidia, AMD, Apple | Compatible OpenAI | Une commande exécute un modèle |
| LM Studio | Interface conviviale | Nvidia, AMD, Apple | Compatible OpenAI | Meilleure découverte de modèles |
| Jan | Clone ChatGPT entièrement local | Nvidia, AMD, Apple | Compatible OpenAI | Chat plus serveur dans une seule application |
| GPT4All | Baseline CPU uniquement | Nvidia, AMD, CPU | API locale | Fonctionne sur du matériel ancien |
| llama.cpp | Contrôle bare-metal | Nvidia, AMD, Apple, CPU | HTTP pur | Le moteur derrière la plupart de la liste |
| Open WebUI | Frontend web pour Ollama | N’importe lequel (client) | Communique avec Ollama | Interface de style ChatGPT pour le LAN |
| LocalAI | Remplacement direct d’OpenAI | Nvidia, AMD, CPU | Compatible OpenAI | Sert aussi les images, audio, embeddings |
Les applications
1. Ollama, meilleur pour “exécuter un modèle en une commande”
Ollama offre un service en arrière-plan qui récupère, quantize et sert les modèles d’une bibliothèque sélectionnée. Une seule commande (ollama run llama3.2) télécharge les poids, charge le modèle et lance l’utilisateur dans un chat. Le service expose un endpoint compatible avec OpenAI sur localhost:11434, donc n’importe quel outil qui parle à OpenAI peut pointer vers le vieux PC et obtenir le même comportement.
Où il échoue : La propre bibliothèque d’Ollama utilise un format de manifeste personnalisé. Apporter un GGUF aléatoire de Hugging Face nécessite un petit Modelfile et une étape d’importation.
Prix : Gratuit, sous licence MIT.
Plateformes : Windows, macOS, Linux.
Télécharger : Ollama
Ligne de fond : Commencez ici. Installez-le, exécutez une commande, et le LAN a un serveur d’IA.
2. LM Studio, meilleur pour interface conviviale
LM Studio est une application de bureau qui parcourt Hugging Face, télécharge les modèles GGUF et les exécute localement. Il dispose d’une interface de chat et d’un bouton “serveur local” qui expose un endpoint compatible avec OpenAI. L’interface affiche l’utilisation prévue de la RAM et de la VRAM avant le téléchargement, ce qui est vraiment utile lors du choix d’une quantification.
Où il échoue : Code fermé. Certaines parties de l’application dépendent de la connectivité Internet même pour une utilisation locale, bien que le modèle s’exécute hors ligne.
Prix : Gratuit pour usage personnel.
Plateformes : Windows, macOS, Linux.
Télécharger : LM Studio
Ligne de fond : Choisissez ceci quand l’ami qui gère le vieux PC ne veut pas toucher à un terminal.
3. Jan, meilleur pour clone ChatGPT entièrement local
Jan est une application de bureau qui se présente comme un client de style ChatGPT, un gestionnaire de modèles et un serveur API local dans un seul paquet. Les téléchargements de modèles sont visibles, et le “mode serveur” met les mêmes modèles à disposition d’autres applications sur le LAN. Tout le design est open-source et axé sur la confidentialité.
Où il échoue : Plus récent qu’Ollama et LM Studio ; occasionnellement des aspérités sur le support des modèles.
Prix : Gratuit, sous licence AGPL.
Plateformes : Windows, macOS, Linux.
Télécharger : Jan
Ligne de fond : Le choix si l’objectif est une seule application qui agit comme un client de chat et un serveur sur le LAN.
4. GPT4All, meilleur pour baseline CPU uniquement
GPT4All a été construit pour le cas où il n’y a pas de GPU du tout. Il exécute les modèles GGUF sur le CPU avec des performances utilisables sur n’importe quelle machine à partir de 2018. L’application de bureau gère les modèles, et un serveur API local peut être activé à partir des paramètres.
Où il échoue : La vitesse sur CPU est limitée par la bande passante de la mémoire. Attendez 4 à 8 tok/s sur un modèle 7B sur un CPU moderne sans GPU.
Prix : Gratuit, sous licence MIT.
Plateformes : Windows, macOS, Linux.
Télécharger : GPT4All
Ligne de fond : Pour le PC de bureau sans GPU. Il exécute quand même un assistant.
5. llama.cpp, meilleur pour contrôle bare-metal
llama.cpp est le moteur que la plupart des applications ci-dessus encapsulent. L’exécuter directement est le chemin le plus rapide sur du vieux matériel car il n’y a pas de surcharge. Le binaire llama-server expose un endpoint HTTP ; le binaire llama-cli exécute un chat interactif. Tout est un seul projet C++ sans runtime.
Où il échoue : Ligne de commande uniquement. La configuration se fait via des flags, pas une interface.
Prix : Gratuit, sous licence MIT.
Plateformes : Windows, macOS, Linux (builds à partir du source partout).
Télécharger : GitHub
Ligne de fond : Le choix quand l’objectif est de tirer chaque dernier token par seconde de la vieille machine.
6. Open WebUI, meilleur pour frontend web
Open WebUI est une interface web auto-hébergée qui communique avec Ollama (ou tout endpoint compatible avec OpenAI). Installez-le sur le vieux PC, et chaque appareil sur le LAN obtient une page de style ChatGPT sur http://server-ip:3000. Les utilisateurs, les permissions, les documents RAG et le routage multi-modèle sont tous intégrés.
Où il échoue : S’exécute au-dessus d’un backend de modèle, nécessite donc Ollama ou un serveur compatible avec OpenAI derrière.
Prix : Gratuit, auto-hébergé ; BSD-3-Clause.
Plateformes : Docker sur n’importe quel hôte.
Télécharger : GitHub
Ligne de fond : L’interface utilisateur que la plupart des familles veulent. Installez-la juste après Ollama.
7. LocalAI, meilleur pour remplacement direct d’OpenAI
LocalAI remplace l’API OpenAI sur le LAN. Les complétions de chat, embeddings, génération d’images (Stable Diffusion), text-to-speech et speech-to-text se situent tous derrière les mêmes endpoints HTTP qu’OpenAI utilise. N’importe quel outil avec un SDK OpenAI fonctionne contre LocalAI en changeant une variable env.
Où il échoue : Un large périmètre signifie un démarrage plus lent. Chaque modalité a ses propres choix de modèles.
Prix : Gratuit, sous licence MIT.
Plateformes : Docker sur Linux, Windows (WSL2), macOS.
Télécharger : LocalAI · GitHub
Ligne de fond : Choisissez ceci quand l’objectif est de remplacer OpenAI par un serveur local dans de nombreuses applications à la fois.
Comment choisir la bonne combinaison
Pour une configuration home-lab qui doit juste fonctionner : Ollama plus Open WebUI. L’un sert les modèles sur le LAN ; l’autre donne à la famille une page à visiter.
Pour un ami qui ne touchera pas à un terminal : LM Studio sur le bureau et laissez-le tchatter localement.
Pour une vieille boîte de bureau CPU uniquement : GPT4All avec un modèle 3B. Ou llama.cpp avec le même modèle si un terminal ça va.
Pour un tout-en-un qui offre chat et serveur sans se diviser en deux applications : Jan.
Pour un foyer exécutant de nombreux outils d’IA (assistants personnels, IDE de codage, applications de notes) : LocalAI pour que chaque outil voie un endpoint de style OpenAI.
FAQ
Quel modèle dois-je exécuter en premier ? Llama 3.2 3B ou Qwen 2.5 3B en Q4_K_M. Les deux tiennent dans 4 GB de RAM, fonctionnent à 15 à 30 tok/s sur un CPU moderne seul et donnent des réponses presque phares pour les questions courantes.
Ai-je besoin d’une GPU ? Non, mais cela change ce que vous pouvez exécuter. Sans GPU, attendez-vous à des modèles 7B à 5 à 10 tok/s. Même avec une Nvidia RTX 3060 d’occasion (12 GB), un modèle 13B à 30 à 50 tok/s devient pratique.
Combien de RAM ai-je besoin ? 16 GB est le minimum pour les modèles 7B. 32 GB ouvre le territoire 13B. 64 GB ou plus commence à tenir 34B et 70B (avec quantification).
Puis-je y accéder de l’extérieur ? Oui, via un VPN mesh comme Tailscale. N’exposez pas un endpoint Ollama ou LocalAI sur Internet public. Il n’y a pas d’auth intégrée par défaut.
Combien d’énergie consomme un vieux PC en veille ? Un vieux bureau avec GPU consomme 40 à 80 W en veille. C’est 50 à 100 dollars par an d’électricité dans la plupart des marchés. Si la machine n’est interrogée que quelques fois par jour, configurez le réveil par LAN dans le BIOS et mettez-la en veille entre les sessions.
Comment cela se compare-t-il à l’exécution d’Ollama sur un Mac mini ? Un Mac mini Apple Silicon avec 16 ou 24 GB de mémoire unifiée est le chemin le plus économe en énergie. Si le vieux PC a encore de la valeur ailleurs, gardez-le. Si vous commencez de zéro, un M1 mini d’occasion surpasse souvent une tour 2018 en watts par token.