Exécuter plusieurs petits LLM locaux sur desktop

XDA a publié un article ce mois-ci arguant que deux modèles locaux de 2 Go s’exécutant en parallèle surpassent un modèle de 8 Go dans presque toutes les tâches réelles, et l’auteur avait raison. Un petit modèle ajusté pour le code plus un petit modèle ajusté pour la conversation, s’exécutant côte à côte, consomme moins de VRAM, répond plus rapidement et vous permet de diriger la bonne question vers le bon outil. La friction réside dans les outils : la plupart des applications LLM locales supposent un seul modèle à la fois et une seule fenêtre de conversation. Les huit applications pour exécuter plusieurs LLM locaux simultanément sur desktop ci-dessous gèrent toutes les modèles concurrents, soit de manière native, soit en exposant un point de terminaison compatible avec OpenAI que la deuxième application peut pointer.

Ce qu'il faut rechercher dans un lanceur LLM multi-modèles

Critères réels pour exécuter plus d’un modèle :

Comparaison rapide

Application Meilleur pour Multi-modèles Plan gratuit Prix initial GUI
Ollama CLI-first, point de terminaison OpenAI Oui (chargement parallèle) Gratuit Gratuit Non (CLI)
LM Studio Gestionnaire de modèles point et clic Oui Gratuit Gratuit Oui
Jan Chat complètement hors ligne + backend Oui Gratuit Gratuit Oui
llama.cpp server Contrôle brut, empreinte minimale Oui (par processus) Gratuit Gratuit Non
LiteLLM Route vers 100+ backends Routeur Gratuit Gratuit (cloud optionnel) Interface Web
Open WebUI Frontend multi-modèles de chat Oui Gratuit Gratuit Oui (web)
vLLM Débit de niveau production Oui (parallélisme tensoriel) Gratuit Gratuit Non
Msty Local + cloud dans une seule application Oui (Split Chat) Gratuit 8,99 USD/mois Oui

Les applications

1. Ollama, le runtime par défaut

Ollama charge et décharge les modèles à la demande et expose une API compatible avec OpenAI sur le port 11434. Définissez OLLAMA_NUM_PARALLEL=2 et OLLAMA_MAX_LOADED_MODELS=3 dans votre environnement, redémarrez le service, et vous pouvez accéder à deux modèles en parallèle depuis n’importe quel client. Sur un M2 Pro avec 32 Go de mémoire unifiée, nous avons exécuté Qwen2.5-Coder 3B et Llama 3.2 3B côte à côte avec de la place pour un petit modèle de vision.

Où cela fait défaut : Pas d’interface graphique native. La longueur de contexte par défaut (2048) est petite pour le travail réel, alors ajustez-la. Le processus ollama serve n’épingle pas automatiquement les modèles à des GPU spécifiques sur les configurations multi-GPU.

Tarification :

Plateformes : macOS, Windows, Linux.

Télécharger : Ollama | GitHub

Conclusion : La couche de base. Presque tous les autres outils de cette liste enveloppent Ollama ou partagent son architecture. Installez-le en premier.

2. LM Studio, l’interface graphique polie

LM Studio est l’application que la plupart des gens installent en premier. Elle est dotée d’un navigateur de modèles complet, d’une interface de conversation et, depuis la version 0.3, d’un serveur local intégré qui exécute plusieurs modèles simultanément. Le catalogue des modèles est extrait directement de Hugging Face et filtré en fonction de ce qui s’adaptera à votre machine. Le mode Split Chat vous permet de comparer deux modèles sur la même invite en temps réel.

Où cela fait défaut : Pas open source (gratuit pour un usage personnel, contactez-les pour un usage commercial). La version llama.cpp incluse peut être en retard par rapport à l’upstream.

Tarification :

Plateformes : Windows, macOS, Linux.

Télécharger : LM Studio

Conclusion : Le meilleur point d’entrée si vous voulez une interface graphique. Associez-le à Ollama pour les scripts.

3. Jan, l’LM Studio open-source

Jan est l’alternative open-source à LM Studio : la même idée, sous licence MIT, et l’objectif déclaré de fonctionner complètement hors ligne. Les fils de conversation multi-modèles permettent à chaque fil de s’épingler à un modèle différent. Il exécute son propre backend llama.cpp et peut faire un proxy vers un Ollama distant ou une API compatible avec OpenAI lorsque vous voulez un modèle plus important.

Où cela fait défaut : Projet plus jeune que LM Studio. Moins d’extensions packagées.

Tarification :

Plateformes : Windows, macOS, Linux.

Télécharger : Jan | GitHub

Conclusion : Choisissez ceci si l’open source est important. Fonctionnellement très similaire à LM Studio.

4. llama.cpp server, la primitive de base

llama.cpp est fourni avec un serveur HTTP sans état que vous lancez par modèle. Deux commandes shell, deux ports, deux modèles. C’est le moyen le plus serré de maintenir deux quantifications GGUF en RAM : pas de wrapper, pas de planificateur, pas de télémétrie, et le plus petit surcoût mémoire de tout ce qui se trouve ici.

Où cela fait défaut : Vous câblez votre propre routage. Pas d’interface graphique. Pas de gestionnaire de modèles. Uniquement la ligne de commande pour la configuration.

Tarification :

Plateformes : Windows, macOS, Linux (également Docker).

Télécharger : GitHub

Conclusion : Pour ceux qui veulent comprendre ce que cachent les couches d’abstraction. Parfait pour les configurations de scripts.

5. LiteLLM, le routeur

LiteLLM n’héberge pas les modèles ; il les achemine. Pointez vers votre instance Ollama, votre serveur LM Studio, votre clé API Anthropic et votre point de terminaison Azure, puis envoyez chaque demande via une URL compatible avec OpenAI et laissez le routeur décider. Un fichier de configuration YAML avec des basculements par modèle et des limites de débit permet à un assistant de codage de basculer vers un modèle local plus petit lorsque le grand est occupé.

Où cela fait défaut : Ajoute un processus supplémentaire à gérer. Le débogage des décisions de routage nécessite quelques lectures de journaux.

Tarification :

Plateformes : Windows, macOS, Linux (Python, Docker).

Télécharger : GitHub

Conclusion : Le lien entre plusieurs runners. Ignorez si vous ne lancez qu’un backend, obligatoire si vous en lancez trois.

6. Open WebUI, l’interface type ChatGPT

Open WebUI est l’interface de conversation polie pour les modèles locaux. Connectez-la à Ollama (ou à n’importe quel point de terminaison compatible avec OpenAI), et elle vous offre l’authentification multi-utilisateurs, l’historique des conversations, la commutation de modèle en milieu de conversation et la comparaison côte à côte des modèles dans un seul onglet du navigateur. Utile pour un ménage où quatre personnes partagent une machine.

Où cela fait défaut : S’exécute dans Docker pour l’expérience fluide ; l’installation native est possible mais plus délicate. Utilise environ 500 Mo de RAM avant le chargement d’un modèle.

Tarification :

Plateformes : Windows, macOS, Linux (Docker).

Télécharger : GitHub

Conclusion : La meilleure interface si vous avez déjà Ollama en cours d’exécution. Le mode Split Chat est la fonctionnalité vedette.

7. vLLM, le moteur de débit

vLLM est ce que vous installez lorsque les outils desktop cessent de s’adapter. La gestion de la mémoire PagedAttention maintient plusieurs modèles avec une meilleure utilisation du VRAM que n’importe quel runner mono-modèle. Le parallélisme tensoriel divise un modèle entre les GPU ; plusieurs déploiements sur le même serveur hébergent différents modèles simultanément. Excessif pour un ordinateur portable, essentiel pour une station de travail avec deux GPU.

Où cela fait défaut : Linux en premier (Windows via WSL2). Nécessite Python et la configuration CUDA. Non destiné aux utilisateurs occasionnels.

Tarification :

Plateformes : Linux, Windows (WSL2), macOS (Apple Silicon partielle).

Télécharger : GitHub

Conclusion : N’atteignez ceci que si vous avez un GPU sérieux. Sur une seule RTX 4090, Ollama est plus facile et presque aussi rapide.

8. Msty, l’application desktop local + cloud

Msty est fourni comme un seul binaire desktop qui exécute des modèles locaux via un runtime intégré et des modèles cloud via vos propres clés API, côte à côte dans la même fenêtre. Split Chat compare jusqu’à quatre modèles par invite. La fonctionnalité Knowledge Stacks indexe les documents locaux et partage l’index entre les modèles.

Où cela fait défaut : Le niveau gratuit est généreux mais plafonne le split chat à deux modèles. Le niveau payant pour un split à quatre voies est du côté cher.

Tarification :

Plateformes : Windows, macOS, Linux.

Télécharger : Msty

Conclusion : Le moyen le plus facile de comparer les modèles locaux et cloud côte à côte. Payez pour cela uniquement si vous avez besoin d’un split à quatre voies.

Comment choisir le bon

FAQ

Puis-je exécuter deux LLM sur un seul GPU ?

Oui, si les deux versions quantifiées tiennent dans le VRAM. Un modèle 3B à Q4_K_M utilise environ 2 Go ; deux d’entre eux tiennent confortablement sur une carte de 8 Go. Définissez OLLAMA_MAX_LOADED_MODELS à plus de 1 pour les garder au chaud.

Les petits LLM locaux sont-ils vraiment bons ?

Depuis Qwen 2.5 et Llama 3.2 dans la plage 3B-7B, les petits modèles traitent les résumés, la complétion de code, l’extraction et les conversations courtes avec une qualité proche de GPT-3.5. Ils échouent sur le raisonnement contextuel long et les tâches multi-étapes complexes. Contournez cela avec un modèle plus grand pour les invites difficiles.

Quelle est la différence entre Ollama et LM Studio ?

Ollama est un runtime CLI-first avec une API HTTP. LM Studio est une application desktop GUI-first qui exécute un serveur llama.cpp intégré. Ils peuvent s’exécuter en parallèle sur la même machine.

Ai-je besoin d’un GPU pour exécuter les LLM locaux ?

Non, mais cela aide. Un modèle 3B s’exécute à une vitesse lisible (10 à 20 tokens/seconde) sur un CPU Apple Silicon moderne ou une puce Intel/AMD avec 16 Go de RAM. Les GPU poussent cela à 60 à 200 tokens/seconde.

Quelle application s’exécute le plus rapidement ?

Par token, vLLM sur un GPU NVIDIA moderne. Par installation, llama.cpp avec une bonne quantification. Par commodité, Ollama.