Les meilleurs apps pour petits LLM locaux sur desktop en 2026

XDA a passé une semaine à tester tous les petits modèles de langage méritant d’être exécutés sur un ordinateur portable ordinaire et nous avons gardé trois gagnants. L’histoire est sortie la même semaine où Qwen 3, Llama 3.2 et Gemma 3 ont tous lancé des quantifications 1B–8B qui surpassent leur poids. Les meilleurs apps pour petits LLM locaux sur desktop ne sont plus des jouets de recherche. Ils tiennent dans 4 GB de RAM, s’exécutent sans GPU discret et répondent aux questions quotidiennes assez vite pour remplacer l’onglet ChatGPT que vous gardez ouvert.

Nous avons testé huit applications sur un MacBook Air M2 (16 GB), un ordinateur portable Ryzen milieu de gamme avec iGPU uniquement et une station de travail Fedora avec une carte NVIDIA 6 GB. Chacun a été jugé sur la rapidité avec laquelle une installation récente pouvait récupérer une quantification 3B, sur la façon dont il gérait une charge de travail mixte de chat, de code et de résumés brefs de documents, et sur sa facilité d’utilisation lors d’un appel vidéo en arrière-plan.

Ce qu’il faut rechercher dans une app de petit LLM local

Comparaison rapide

App Meilleur pour Plateformes Plan gratuit Payant Note
Jan Client ChatGPT-like open source Windows, macOS, Linux Entièrement gratuit Aucun 4.7
Ollama Runtime CLI + API plus simple Windows, macOS, Linux Entièrement gratuit Aucun 4.9
LM Studio Découverte de modèles avec vrai GUI Windows, macOS, Linux Entièrement gratuit personnel Contactez les ventes pour professionnel 4.8
GPT4All Local + secours cloud optionnel Windows, macOS, Linux Entièrement gratuit Aucun 4.5
Msty Comparaison de chat divisé entre modèles Windows, macOS, Linux Entièrement gratuit Aurum $99 à vie 4.7
llamafile Modèle portable fichier unique Windows, macOS, Linux Entièrement gratuit Aucun 4.6
Cortex Runtime style Ollama, empreinte réduite Windows, macOS, Linux Entièrement gratuit Aucun 4.4
KoboldCpp Écriture créative à contexte long Windows, macOS, Linux Entièrement gratuit Aucun 4.5

Les apps

1. Jan pour petit LLM local — Meilleur client open source style ChatGPT

Jan propose une app de bureau style ChatGPT qui paraît familière dès que vous l’ouvrez, puis récupère discrètement Llama 3.2 3B ou Qwen 3 4B en arrière-plan. Les assistants, les fils, les téléversements de fichiers et un serveur compatible OpenAI sont intégrés. Sur le MacBook Air M2, un premier chat avec Llama 3.2 3B répondait aux questions en trois minutes après l’installation.

Où elle pêche: Le démarrage à froid sur Windows traîne toujours derrière macOS de quelques secondes. Certains imports de Hugging Face nécessitent un dépôt GGUF manuel.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: jan.ai · github.com/janhq/jan

Conclusion: Le choix si vous voulez l’expérience ChatGPT sans abonnement ni connexion internet.

2. Ollama pour petit LLM local — Meilleur runtime CLI + API plus simple

Ollama est le runtime sur lequel tout le reste s’appuie. ollama run llama3.2:3b récupère la quantification, la charge et lance le chat. L’API compatible OpenAI sur le port 11434 signifie que n’importe quel éditeur, app de prise de notes ou script qui parle OpenAI peut communiquer avec lui sans modifications.

Où il pêche: Pas de GUI natif. Vous l’appareilerez avec Open WebUI ou Msty pour une fenêtre de chat.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: ollama.com · github.com/ollama/ollama

Conclusion: Commencez ici même si vous installez aussi un client de chat. La plupart des autres apps de cette liste peuvent pointer vers Ollama.

3. LM Studio pour petit LLM local — Meilleure découverte de modèles avec vrai GUI

LM Studio est l’app tout-en-un pour parcourir Hugging Face, choisir une quantification et chatter sans toucher à un terminal. Le navigateur de modèles filtre par taille et licence, ce qui compte quand vous essayez d’adapter un modèle à 6 GB de RAM. Le serveur API local est un simple bouton.

Où il pêche: Pas open source. Le support Linux traîne derrière Windows et macOS pour les nouvelles fonctionnalités.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: lmstudio.ai

Conclusion: Le GUI le plus fluide pour explorer et tester les petites quantifications côte à côte.

4. GPT4All pour petit LLM local — Meilleur local plus secours cloud optionnel

GPT4All fournit une app de chat native qui exécute les quantifications GGUF localement et peut aussi acheminer vers OpenAI ou Groq quand un modèle plus puissant est nécessaire. LocalDocs vous permet de pointer vers un dossier et d’obtenir des réponses fondées sans envoyer les fichiers nulle part.

Où il pêche: Le catalogue de modèles est un cran derrière LM Studio. L’offload GPU sur Windows nécessite quelques réglages.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: gpt4all.io

Conclusion: Choisissez ceci quand vous voulez une app qui démarre localement et peut emprunter le cloud à la demande.

5. Msty pour petit LLM local — Meilleure comparaison de chat divisé entre modèles

Msty affiche deux ou trois réponses de modèles côte à côte. C’est le moyen le plus rapide de décider si Qwen 3 4B ou Gemma 3 4B correspond à votre style d’invite. Il parle à Ollama, LM Studio et aux API cloud, donc la comparaison n’est pas limitée à ce qu’il héberge.

Où il pêche: Certaines fonctionnalités avancées sont derrière l’étage Aurum. Pas open source.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: msty.app

Conclusion: Le choix si vous auditionnez souvent des modèles et voulez les voir débattre.

6. llamafile pour petit LLM local — Meilleur modèle portable fichier unique

llamafile enveloppe un modèle et son runtime dans un exécutable unique. Placez-le sur une clé USB, double-cliquez sur n’importe quelle machine Windows, macOS ou Linux, et un onglet de navigateur s’ouvre avec un chat. C’est la contribution de Mozilla à Cosmopolitan libc, et cela supprime complètement l’étape d’installation.

Où il pêche: Les fichiers peuvent faire 3–5 GB. Le premier lancement sur des machines d’entreprise verrouillées peut nécessiter un clic droit.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: github.com/Mozilla-Ocho/llamafile

Conclusion: Le bon choix pour la portabilité, pour les démos ou pour une machine où vous ne pouvez pas installer de logiciel.

7. Cortex pour petit LLM local — Meilleur runtime style Ollama avec empreinte réduite

Cortex est le runtime qui alimente Jan sous le capot, exposé en tant que daemon autonome. C’est une empreinte mémoire réduite par rapport à Ollama au repos et utilise par défaut llama.cpp avec une API compatible OpenAI. Les téléchargements de modèles utilisent le même écosystème GGUF.

Où il pêche: Communauté plus petite, donc moins d’intégrations tierces. La documentation rattrape toujours son retard.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: cortex.so · github.com/janhq/cortex.cpp

Conclusion: Choisissez ceci si Ollama vous semble lourd et vous voulez un daemon plus léger qui parle toujours l’API OpenAI.

8. KoboldCpp pour petit LLM local — Meilleur pour écriture créative à contexte long

KoboldCpp est le fork de llama.cpp construit autour de la fiction, du jeu de rôle et de l’écriture à contexte long. La mémoire de personnage persistante, les infos de monde et une interface de navigateur centrée sur la rédaction plutôt que sur les questions-réponses la distinguent utilement des autres apps de cette liste. Elle gère les contextes 32K–128K sur les petits modèles mieux que la plupart des GUI.

Où il pêche: L’interface est dense et résolument pour power-users. Pas l’app à donner à un ami non technique.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: github.com/LostRuins/koboldcpp

Conclusion: Le choix si la raison pour laquelle vous voulez un modèle local est les sessions d’écriture que ChatGPT limiterait en débit.

Comment choisir le bon

Si vous voulez la configuration la plus simple qui fonctionne: Ollama plus un client de chat. Installez Ollama, puis choisissez Jan ou Open WebUI par-dessus.

Si vous voulez une app de bureau polie: LM Studio pour le GUI, ou Jan si l’open source compte.

Si vous auditionnez souvent des modèles: Msty pour la vue divisée.

Si vous faites une démo à quelqu’un ou travaillez sur une machine verrouillée: llamafile.

Si vous voulez le daemon le plus léger: Cortex.

Si vous écrivez de la longue fiction ou menez des campagnes de jeu de rôle: KoboldCpp.

Si un petit modèle n’est pas suffisant pour une tâche spécifique, la plupart de ces apps acheminent aussi vers des points de terminaison cloud. Commencez localement, escaladez seulement quand la réponse locale n’est pas assez bonne.

FAQ

Quelle est la meilleure app de petit LLM local pour un ordinateur portable sans GPU? Ollama avec un modèle 3B ou 4B s’exécute sur CPU et graphiques intégrés avec une vitesse acceptable. LM Studio fournit des présets CPU uniquement dans son sélecteur de modèles.

Un petit LLM local peut-il remplacer ChatGPT? Pour le chat quotidien, les résumés et l’assistance à la codification courte, oui. Pour le raisonnement lourd, les flux de travail d’agents et les tâches de recherche longues, non. La plupart des gens qui essaient les deux finissent par utiliser le local pour les invites quotidiennes et le cloud pour les difficiles.

Quelle taille de modèle s’exécute sur 8 GB de RAM? Un modèle 3B en quantification Q4 s’adapte confortablement avec de la marge pour l’app elle-même. Une quantification 4B fonctionne si vous fermez d’autres apps consommatrices de mémoire.

Les LLM locaux sont-ils vraiment privés? Les apps de cette liste n’envoient pas les invites par défaut. GPT4All et Msty proposent un acheminement cloud optionnel, et c’est volontaire. Si l’isolation totale importe, désactivez l’accès réseau pour l’app.

Quelle est la meilleure app de petit LLM local gratuite? Ollama pour le runtime et Jan pour le GUI. Les deux sont gratuits, les deux sont open source, les deux sont activement maintenus.