XDA a publié un article ce mois-ci arguant qu’une pile IA locale plus petite est une pile IA locale plus productive. L’auteur avait accumulé le bazar habituel : deux lanceurs de modèles, trois interfaces utilisateur, une base de données vectorielle que personne n’utilisait et un dossier d’adaptateurs qu’il avait oublié. Réduire à un ensemble minimal a rendu la configuration plus facile à maintenir et plus facile d’accès. Nous avons testé huit des meilleures applications pour une pile IA locale minimaliste sur bureau, sur un MacBook Pro M3, une station de travail Windows avec une RTX 4070 et une boîte Debian avec une AMD 7800 XT, en nous concentrant sur la façon dont chacune se comporte comme le seul outil de la pile plutôt que l’un des nombreux.
Ce qu’il faut rechercher dans une application IA locale minimaliste
- Installation binaire unique ou proche. Un outil qui est un
brew installou un.msisurpasse un outil qui nécessite Docker plus Python plus un fichier de configuration. - Gestion des modèles qui n’interfère pas. Télécharger un GGUF doit être une commande. En supprimer un ne doit pas nécessiter la recherche d’un dossier caché.
- Compatibilité API. Un point de terminaison compatible avec OpenAI est ce qui vous permet de pointer n’importe quel outil existant sur votre modèle local sans réécrire les deux côtés.
- Détection automatique du GPU et du CPU. La pile doit déterminer si vous avez Metal, CUDA, ROCm ou CPU uniquement et utiliser le bon. La sélection manuelle du backend est le bazar que ces outils étaient censés éliminer.
- Discipline de la RAM. Un outil qui fonctionne au ralenti avec 2 GB de RAM pour servir un modèle qui tient en 8 GB fait quelque chose de mal.
Comparaison rapide
| Application | Meilleur pour | Plates-formes | Plan gratuit | Prix de départ | Caractéristique remarquable |
|---|---|---|---|---|---|
| llama.cpp | Runtime de référence | Windows, macOS, Linux | Gratuit, open source | Gratuit | Inférence binaire unique portable |
| llamafile | Un fichier, pas d’installation | Windows, macOS, Linux | Gratuit, open source | Gratuit | Modèle plus runtime dans un exécutable |
| Ollama | CLI plus simple plus API | Windows, macOS, Linux | Gratuit, open source | Gratuit | ollama run et vous avez un point de terminaison OpenAI |
| Jan | Interface utilisateur de bureau native avec API | Windows, macOS, Linux | Gratuit, open source | Gratuit | Chat de bureau multiplateforme |
| KoboldCpp | Interface utilisateur binaire unique plus API | Windows, macOS, Linux | Gratuit, open source | Gratuit | Exécuteur GGUF avec interface web intégrée |
| Msty | Interface utilisateur commerciale polie sur modèles locaux | Windows, macOS, Linux | Niveau gratuit | Abonnement Msty pour fonctionnalités avancées | Interface de chat multi-modèles |
| GPT4All | Chat de bureau le plus simple | Windows, macOS, Linux | Gratuit, open source | Gratuit | Convivial pour les débutants, pas de CLI |
| LM Studio | Exécuteur local complet | Windows, macOS, Linux | Gratuit pour usage personnel | Licence commerciale | Interface de découverte de modèles, large support backend |
Les applications
1. llama.cpp — Meilleur pour le runtime de référence sur lequel tout le monde construit
llama.cpp est le runtime que la plupart de cette liste enveloppe d’une façon ou d’une autre. C’est un serveur d’inférence C++ portable et sans dépendances qui exécute les modèles GGUF sur CPU, Metal, CUDA et ROCm. En tant que pile minimaliste en soi, llama-server vous donne un point de terminaison compatible avec OpenAI, et llama-cli vous donne un REPL. C’est suffisant pour la plupart des travaux d’IA locale.
Où ça fait défaut : Pas d’interface utilisateur polie. Vous compilez ou téléchargez un binaire de version. La gestion des modèles est manuelle.
Tarification :
- Gratuit : Complètement open source
- Payant : Aucun
Plates-formes : Windows, macOS, Linux
Télécharger : github.com/ggerganov/llama.cpp
En résumé : llama.cpp est le choix lorsque vous voulez le moins de pièces mobiles et que vous êtes à l’aise dans un terminal.
2. llamafile — Meilleur pour un runtime et un modèle dans un exécutable
llamafile du projet Mozilla Ocho combine un modèle et le runtime llama.cpp en un seul binaire Cosmopolitan-libc qui s’exécute sur Windows, macOS et Linux sans installation. Téléchargez le fichier, chmod-le, exécutez-le. Il ouvre une interface utilisateur du navigateur et expose une API compatible avec OpenAI sur localhost. C’est l’interprétation la plus littérale d’« IA locale minimaliste » de la liste.
Où ça fait défaut : Les fichiers binaires portables uniques peuvent déclencher des outils de sécurité hôte. Télécharger un nouveau modèle signifie télécharger un nouveau llamafile.
Tarification :
- Gratuit : Complètement open source
- Payant : Aucun
Plates-formes : Windows, macOS, Linux
Télécharger : github.com/Mozilla-Ocho/llamafile
En résumé : llamafile est le choix lorsque l’installation doit être un fichier et un seul.
3. Ollama — Meilleur pour le flux de travail CLI plus simple plus API
Ollama enveloppe llama.cpp avec l’expérience d’installation et de commande la plus propre de tout ce qui se trouve sur cette liste. ollama pull llama3.2:8b télécharge un modèle. ollama run llama3.2:8b ouvre un chat. ollama serve expose un point de terminaison compatible avec OpenAI sur le port 11434 par défaut. Le format Modelfile vous permet d’épingler les invites système et les paramètres avec un seul fichier texte.
Où ça fait défaut : L’installation par défaut exécute le serveur en tant que service d’arrière-plan que vous ne voudrez peut-être pas. La quantification manuelle des modèles est limitée par rapport au llama.cpp brut.
Tarification :
- Gratuit : Complètement open source
- Payant : Aucun
Plates-formes : Windows, macOS, Linux
Télécharger : ollama.com
En résumé : Ollama est le choix lorsque l’installation en une commande et l’exécution en une commande sont la barre minimale.
4. Jan — Meilleur pour une interface utilisateur de bureau native que vous possédez
Jan est une application de bureau créée à partir de zéro pour les modèles locaux, open source, avec un serveur API compatible avec OpenAI intégré. C’est ce que vous installez lorsque vous voulez une véritable interface utilisateur de chat de bureau sans la surface de LM Studio. L’équipe livre des compilations pour les trois systèmes d’exploitation et maintient le flux de découverte des modèles simple.
Où ça fait défaut : Projet plus jeune que LM Studio ou Ollama. Certaines fonctionnalités avancées (backends spécialisés, personnalisation profonde des modèles) sont à la traîne.
Tarification :
- Gratuit : Complètement open source
- Payant : Aucun
Plates-formes : Windows, macOS, Linux
Télécharger : jan.ai
En résumé : Jan est le choix lorsqu’une véritable interface utilisateur de bureau est le facteur décisif.
5. KoboldCpp — Meilleur pour une interface utilisateur binaire unique plus API sur une cible portable
KoboldCpp a commencé comme un fork de llama.cpp destiné à la communauté KoboldAI, et s’est développé en un exécuteur GGUF binaire unique avec une interface utilisateur de navigateur, un point de terminaison API, une prise en charge d’entrée d’image et d’audio, et aucune étape d’installation. Placez le binaire et un GGUF à côté, exécutez une commande et c’est tout.
Où ça fait défaut : Certaines fonctionnalités spécialisées (intégration Horde, invites spécifiques à KoboldAI) n’importent pas pour un cas d’usage de chat général.
Tarification :
- Gratuit : Complètement open source
- Payant : Aucun
Plates-formes : Windows, macOS, Linux
Télécharger : github.com/LostRuins/koboldcpp
En résumé : KoboldCpp est le choix lorsque vous voulez un seul binaire qui vous donne à la fois une interface utilisateur et une API sans une application plus lourde.
6. Msty — Meilleur pour une interface utilisateur commerciale polie sur modèles locaux
Msty prend l’approche LM Studio et produit une interface utilisateur plus propre. Chattez côte à côte avec plusieurs modèles, connectez-vous à des points de terminaison Ollama ou Jan locaux, et organisez les conversations dans des dossiers. Le niveau gratuit est généreux ; le niveau payant déverrouille les fonctionnalités multi-utilisateurs et d’espace de travail.
Où ça fait défaut : Code source fermé. Pas dans le sens minimaliste « installer un seul binaire open source ». Pour un utilisateur solo qui préfère le polissage aux principes, c’est bien.
Tarification :
- Gratuit : Interface utilisateur centrale complète
- Payant : Abonnement Msty pour les fonctionnalités avancées d’espace de travail
Plates-formes : Windows, macOS, Linux
Télécharger : msty.app
En résumé : Msty est le choix lorsque le polissage de l’interface utilisateur vaut la peine de renoncer à la contrainte open source.
7. GPT4All — Meilleur pour un chat de bureau convivial pour les débutants
GPT4All de Nomic est le moyen le plus convivial pour lancer un LLM local pour quelqu’un qui ne veut pas toucher un terminal. Installez l’application, parcourez une liste de modèles conservée, choisissez-en un, discutez. Il expose également une API locale et s’intègre à Nomic Atlas pour la RAG basée sur les documents si vous décidez d’aller au-delà du chat.
Où ça fait défaut : La liste des modèles conservée est un petit sous-ensemble de ce qui est disponible sur Hugging Face. Les utilisateurs avancés s’en éloignent.
Tarification :
- Gratuit : Complètement open source
- Payant : Aucun
Plates-formes : Windows, macOS, Linux
Télécharger : gpt4all.io
En résumé : GPT4All est le choix pour un utilisateur d’IA locale pour la première fois qui veut une application de bureau qui fonctionne simplement.
8. LM Studio — Meilleur pour un exécuteur local complet
LM Studio est le bout maximaliste d’« encore une seule application de bureau ». Découverte de modèles à partir de Hugging Face, support de plusieurs backends (llama.cpp, MLX sur Apple Silicon), interface utilisateur de chat complète, serveur API et surface de configuration des modèles qui expose tout. C’est à quoi les gens se raccordent par défaut lorsque la simplicité d’Ollama est trop limitée.
Où ça fait défaut : Pas open source. Empreinte d’installation plus grande que les choix ci-dessus. La surface des fonctionnalités maximalistes est le contraire de la pile minimaliste que défendait l’article de XDA, mais elle est incluse ici comme point de référence pour ce qui se passe lorsque vous refusez de réduire.
Tarification :
- Gratuit : Usage personnel
- Payant : Licence commerciale pour les déploiements commerciaux
Plates-formes : Windows, macOS, Linux
Télécharger : lmstudio.ai
En résumé : LM Studio est le choix lorsqu’un exécuteur local complet vaut le coût d’une installation plus grande que n’importe laquelle des options ci-dessus.
Comment choisir le bon
- La pile minimale viable : Ollama. Installez-le, tirez un modèle, c’est fait. Tout le reste est optionnel.
- Si vous préférez un seul fichier et pas d’installation : llamafile.
- Si vous voulez le runtime de référence sans wrapper : llama.cpp directement.
- Si vous voulez une interface utilisateur de chat de bureau et open source : Jan.
- Si vous voulez un seul binaire qui soit aussi une interface utilisateur : KoboldCpp.
- Si le polissage compte plus que l’open source : Msty au-dessus d’un point de terminaison Ollama.
- Si vous n’avez jamais installé un modèle local auparavant : GPT4All.
- Si vous avez dépassé Ollama et voulez plus de boutons : LM Studio.
FAQ
Quel modèle dois-je exécuter sur 16 GB de RAM ? Une quantification Q4 d’un modèle 7B ou 8B fonctionne bien dans cette enveloppe et couvre la plupart des cas d’usage de chat et de codage. La quantification Q4 d’un 13B est possible mais serrée.
Ces applications fonctionnent-elles sur Apple Silicon ? Oui. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio et Msty utilisent tous Metal sur Apple Silicon et obtiennent une vitesse quasi-native. llamafile est livré avec des binaires Apple Silicon.
Puis-je pointer les outils de style ChatGPT vers un modèle local ? Oui. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio et llamafile exposent tous un point de terminaison compatible avec OpenAI sur localhost. Pointez n’importe quel outil qui accepte une URL de base personnalisée vers http://localhost:<port>/v1.
En quoi une pile minimaliste diffère-t-elle d’une pile maximaliste ? Moins de pièces mobiles. Un runtime, un gestionnaire de modèles, une interface utilisateur. Les piles maximalistes ajoutent des bases de données vectorielles, des couches d’orchestration et des frameworks d’agents. La plupart des utilisateurs seuls n’ont besoin d’aucun d’entre eux jusqu’à ce qu’un problème spécifique l’exige.
Lesquels d’entre eux sont capables d’agent prêts à l’emploi ? Non. Il s’agit de runtimes d’inférence et d’interfaces utilisateur de chat. Pour une boucle d’agent, vous ajoutez un outil séparé qui parle le protocole OpenAI Chat Completions contre l’un de ces points de terminaison.
Quelle pile est la plus petite sur le disque ? llamafile plus un seul modèle quantifié est l’installation la plus légère possible. Ollama plus son magasin de modèles est un close-second et plus facile de croître.