XDA a passé une semaine à tester tous les petits modèles de langage méritant d’être exécutés sur un ordinateur portable ordinaire et nous avons gardé trois gagnants. L’histoire est sortie la même semaine où Qwen 3, Llama 3.2 et Gemma 3 ont tous lancé des quantifications 1B–8B qui surpassent leur poids. Les meilleurs apps pour petits LLM locaux sur desktop ne sont plus des jouets de recherche. Ils tiennent dans 4 GB de RAM, s’exécutent sans GPU discret et répondent aux questions quotidiennes assez vite pour remplacer l’onglet ChatGPT que vous gardez ouvert.
Nous avons testé huit applications sur un MacBook Air M2 (16 GB), un ordinateur portable Ryzen milieu de gamme avec iGPU uniquement et une station de travail Fedora avec une carte NVIDIA 6 GB. Chacun a été jugé sur la rapidité avec laquelle une installation récente pouvait récupérer une quantification 3B, sur la façon dont il gérait une charge de travail mixte de chat, de code et de résumés brefs de documents, et sur sa facilité d’utilisation lors d’un appel vidéo en arrière-plan.
Ce qu’il faut rechercher dans une app de petit LLM local
- Catalogue de modèles petits. Récupérations directes pour Llama 3.2 (1B/3B), Qwen 3 (0.5B–8B), Gemma 3 (2B/4B), Phi-4-mini et SmolLM sans chasser Hugging Face.
- Présets de quantification. Les quantifications GGUF 4-bit et 5-bit sont le meilleur compromis sur les machines 8–16 GB. L’app devrait par défaut choisir quelque chose de sensé.
- Secours CPU uniquement. Tout le monde n’a pas un GPU. L’app devrait rester utilisable sur une puce graphique intégrée ou un processeur simple.
- Empreinte mémoire. Combien de RAM l’app elle-même utilise avant de charger un modèle. Certains shells Electron consomment 800 MB au repos.
- API compatible OpenAI. Pour qu’un éditeur de code, une app de prise de notes ou un script shell puisse envoyer des invites au même processus.
- Démarrage à froid. Le temps entre le double-clic et un chat actif compte quand la raison de vouloir du local est d’éviter l’onglet du navigateur.
Comparaison rapide
| App | Meilleur pour | Plateformes | Plan gratuit | Payant | Note |
|---|---|---|---|---|---|
| Jan | Client ChatGPT-like open source | Windows, macOS, Linux | Entièrement gratuit | Aucun | 4.7 |
| Ollama | Runtime CLI + API plus simple | Windows, macOS, Linux | Entièrement gratuit | Aucun | 4.9 |
| LM Studio | Découverte de modèles avec vrai GUI | Windows, macOS, Linux | Entièrement gratuit personnel | Contactez les ventes pour professionnel | 4.8 |
| GPT4All | Local + secours cloud optionnel | Windows, macOS, Linux | Entièrement gratuit | Aucun | 4.5 |
| Msty | Comparaison de chat divisé entre modèles | Windows, macOS, Linux | Entièrement gratuit | Aurum $99 à vie | 4.7 |
| llamafile | Modèle portable fichier unique | Windows, macOS, Linux | Entièrement gratuit | Aucun | 4.6 |
| Cortex | Runtime style Ollama, empreinte réduite | Windows, macOS, Linux | Entièrement gratuit | Aucun | 4.4 |
| KoboldCpp | Écriture créative à contexte long | Windows, macOS, Linux | Entièrement gratuit | Aucun | 4.5 |
Les apps
1. Jan pour petit LLM local — Meilleur client open source style ChatGPT
Jan propose une app de bureau style ChatGPT qui paraît familière dès que vous l’ouvrez, puis récupère discrètement Llama 3.2 3B ou Qwen 3 4B en arrière-plan. Les assistants, les fils, les téléversements de fichiers et un serveur compatible OpenAI sont intégrés. Sur le MacBook Air M2, un premier chat avec Llama 3.2 3B répondait aux questions en trois minutes après l’installation.
Où elle pêche: Le démarrage à froid sur Windows traîne toujours derrière macOS de quelques secondes. Certains imports de Hugging Face nécessitent un dépôt GGUF manuel.
Tarification:
- Gratuit: Entièrement gratuit, open source sous AGPL.
- Payant: Aucun.
Plateformes: Windows, macOS, Linux.
Télécharger: jan.ai · github.com/janhq/jan
Conclusion: Le choix si vous voulez l’expérience ChatGPT sans abonnement ni connexion internet.
2. Ollama pour petit LLM local — Meilleur runtime CLI + API plus simple
Ollama est le runtime sur lequel tout le reste s’appuie. ollama run llama3.2:3b récupère la quantification, la charge et lance le chat. L’API compatible OpenAI sur le port 11434 signifie que n’importe quel éditeur, app de prise de notes ou script qui parle OpenAI peut communiquer avec lui sans modifications.
Où il pêche: Pas de GUI natif. Vous l’appareilerez avec Open WebUI ou Msty pour une fenêtre de chat.
Tarification:
- Gratuit: Entièrement gratuit, licence MIT.
- Payant: Aucun.
Plateformes: Windows, macOS, Linux.
Télécharger: ollama.com · github.com/ollama/ollama
Conclusion: Commencez ici même si vous installez aussi un client de chat. La plupart des autres apps de cette liste peuvent pointer vers Ollama.
3. LM Studio pour petit LLM local — Meilleure découverte de modèles avec vrai GUI
LM Studio est l’app tout-en-un pour parcourir Hugging Face, choisir une quantification et chatter sans toucher à un terminal. Le navigateur de modèles filtre par taille et licence, ce qui compte quand vous essayez d’adapter un modèle à 6 GB de RAM. Le serveur API local est un simple bouton.
Où il pêche: Pas open source. Le support Linux traîne derrière Windows et macOS pour les nouvelles fonctionnalités.
Tarification:
- Gratuit: Entièrement gratuit pour un usage personnel.
- Payant: Contactez les ventes pour les déploiements commerciaux.
Plateformes: Windows, macOS, Linux.
Télécharger: lmstudio.ai
Conclusion: Le GUI le plus fluide pour explorer et tester les petites quantifications côte à côte.
4. GPT4All pour petit LLM local — Meilleur local plus secours cloud optionnel
GPT4All fournit une app de chat native qui exécute les quantifications GGUF localement et peut aussi acheminer vers OpenAI ou Groq quand un modèle plus puissant est nécessaire. LocalDocs vous permet de pointer vers un dossier et d’obtenir des réponses fondées sans envoyer les fichiers nulle part.
Où il pêche: Le catalogue de modèles est un cran derrière LM Studio. L’offload GPU sur Windows nécessite quelques réglages.
Tarification:
- Gratuit: Entièrement gratuit, open source.
- Payant: Aucun.
Plateformes: Windows, macOS, Linux.
Télécharger: gpt4all.io
Conclusion: Choisissez ceci quand vous voulez une app qui démarre localement et peut emprunter le cloud à la demande.
5. Msty pour petit LLM local — Meilleure comparaison de chat divisé entre modèles
Msty affiche deux ou trois réponses de modèles côte à côte. C’est le moyen le plus rapide de décider si Qwen 3 4B ou Gemma 3 4B correspond à votre style d’invite. Il parle à Ollama, LM Studio et aux API cloud, donc la comparaison n’est pas limitée à ce qu’il héberge.
Où il pêche: Certaines fonctionnalités avancées sont derrière l’étage Aurum. Pas open source.
Tarification:
- Gratuit: Chat entièrement gratuit et vue divisée.
- Payant: Aurum $99 à vie pour les piles de connaissances et les extras premium.
Plateformes: Windows, macOS, Linux.
Télécharger: msty.app
Conclusion: Le choix si vous auditionnez souvent des modèles et voulez les voir débattre.
6. llamafile pour petit LLM local — Meilleur modèle portable fichier unique
llamafile enveloppe un modèle et son runtime dans un exécutable unique. Placez-le sur une clé USB, double-cliquez sur n’importe quelle machine Windows, macOS ou Linux, et un onglet de navigateur s’ouvre avec un chat. C’est la contribution de Mozilla à Cosmopolitan libc, et cela supprime complètement l’étape d’installation.
Où il pêche: Les fichiers peuvent faire 3–5 GB. Le premier lancement sur des machines d’entreprise verrouillées peut nécessiter un clic droit.
Tarification:
- Gratuit: Entièrement gratuit, Apache 2.0.
- Payant: Aucun.
Plateformes: Windows, macOS, Linux.
Télécharger: github.com/Mozilla-Ocho/llamafile
Conclusion: Le bon choix pour la portabilité, pour les démos ou pour une machine où vous ne pouvez pas installer de logiciel.
7. Cortex pour petit LLM local — Meilleur runtime style Ollama avec empreinte réduite
Cortex est le runtime qui alimente Jan sous le capot, exposé en tant que daemon autonome. C’est une empreinte mémoire réduite par rapport à Ollama au repos et utilise par défaut llama.cpp avec une API compatible OpenAI. Les téléchargements de modèles utilisent le même écosystème GGUF.
Où il pêche: Communauté plus petite, donc moins d’intégrations tierces. La documentation rattrape toujours son retard.
Tarification:
- Gratuit: Entièrement gratuit, open source.
- Payant: Aucun.
Plateformes: Windows, macOS, Linux.
Télécharger: cortex.so · github.com/janhq/cortex.cpp
Conclusion: Choisissez ceci si Ollama vous semble lourd et vous voulez un daemon plus léger qui parle toujours l’API OpenAI.
8. KoboldCpp pour petit LLM local — Meilleur pour écriture créative à contexte long
KoboldCpp est le fork de llama.cpp construit autour de la fiction, du jeu de rôle et de l’écriture à contexte long. La mémoire de personnage persistante, les infos de monde et une interface de navigateur centrée sur la rédaction plutôt que sur les questions-réponses la distinguent utilement des autres apps de cette liste. Elle gère les contextes 32K–128K sur les petits modèles mieux que la plupart des GUI.
Où il pêche: L’interface est dense et résolument pour power-users. Pas l’app à donner à un ami non technique.
Tarification:
- Gratuit: Entièrement gratuit, AGPL.
- Payant: Aucun.
Plateformes: Windows, macOS, Linux.
Télécharger: github.com/LostRuins/koboldcpp
Conclusion: Le choix si la raison pour laquelle vous voulez un modèle local est les sessions d’écriture que ChatGPT limiterait en débit.
Comment choisir le bon
Si vous voulez la configuration la plus simple qui fonctionne: Ollama plus un client de chat. Installez Ollama, puis choisissez Jan ou Open WebUI par-dessus.
Si vous voulez une app de bureau polie: LM Studio pour le GUI, ou Jan si l’open source compte.
Si vous auditionnez souvent des modèles: Msty pour la vue divisée.
Si vous faites une démo à quelqu’un ou travaillez sur une machine verrouillée: llamafile.
Si vous voulez le daemon le plus léger: Cortex.
Si vous écrivez de la longue fiction ou menez des campagnes de jeu de rôle: KoboldCpp.
Si un petit modèle n’est pas suffisant pour une tâche spécifique, la plupart de ces apps acheminent aussi vers des points de terminaison cloud. Commencez localement, escaladez seulement quand la réponse locale n’est pas assez bonne.
FAQ
Quelle est la meilleure app de petit LLM local pour un ordinateur portable sans GPU? Ollama avec un modèle 3B ou 4B s’exécute sur CPU et graphiques intégrés avec une vitesse acceptable. LM Studio fournit des présets CPU uniquement dans son sélecteur de modèles.
Un petit LLM local peut-il remplacer ChatGPT? Pour le chat quotidien, les résumés et l’assistance à la codification courte, oui. Pour le raisonnement lourd, les flux de travail d’agents et les tâches de recherche longues, non. La plupart des gens qui essaient les deux finissent par utiliser le local pour les invites quotidiennes et le cloud pour les difficiles.
Quelle taille de modèle s’exécute sur 8 GB de RAM? Un modèle 3B en quantification Q4 s’adapte confortablement avec de la marge pour l’app elle-même. Une quantification 4B fonctionne si vous fermez d’autres apps consommatrices de mémoire.
Les LLM locaux sont-ils vraiment privés? Les apps de cette liste n’envoient pas les invites par défaut. GPT4All et Msty proposent un acheminement cloud optionnel, et c’est volontaire. Si l’isolation totale importe, désactivez l’accès réseau pour l’app.
Quelle est la meilleure app de petit LLM local gratuite? Ollama pour le runtime et Jan pour le GUI. Les deux sont gratuits, les deux sont open source, les deux sont activement maintenus.