XDA a publié un article ce mois-ci arguant que deux modèles locaux de 2 Go s’exécutant en parallèle surpassent un modèle de 8 Go dans presque toutes les tâches réelles, et l’auteur avait raison. Un petit modèle ajusté pour le code plus un petit modèle ajusté pour la conversation, s’exécutant côte à côte, consomme moins de VRAM, répond plus rapidement et vous permet de diriger la bonne question vers le bon outil. La friction réside dans les outils : la plupart des applications LLM locales supposent un seul modèle à la fois et une seule fenêtre de conversation. Les huit applications pour exécuter plusieurs LLM locaux simultanément sur desktop ci-dessous gèrent toutes les modèles concurrents, soit de manière native, soit en exposant un point de terminaison compatible avec OpenAI que la deuxième application peut pointer.
Ce qu'il faut rechercher dans un lanceur LLM multi-modèles
Critères réels pour exécuter plus d’un modèle :
- Chargement natif multi-modèles. Certains outils échangent les modèles sur demande ; d’autres maintiennent réellement deux modèles chargés en RAM.
- Point de terminaison compatible avec OpenAI. Un serveur fonctionnant sur le port 11434 ou 1234 que d’autres outils peuvent appeler.
- Routage des modèles. Envoyez les invites de code à Qwen2.5-Coder, les conversations à Llama 3.2, selon la demande.
- Déchargement GPU avec fractionnement des couches. Chargez deux petits modèles sur le même GPU sans que l’un ne plante.
- Secours du CPU pour un deuxième modèle. Si le GPU est plein, le deuxième modèle s’exécute sur le CPU sans défaillance.
- Isolation des sessions. Deux conversations ne se marchent pas sur la fenêtre de contexte l’une l’autre.
Comparaison rapide
| Application | Meilleur pour | Multi-modèles | Plan gratuit | Prix initial | GUI |
|---|---|---|---|---|---|
| Ollama | CLI-first, point de terminaison OpenAI | Oui (chargement parallèle) | Gratuit | Gratuit | Non (CLI) |
| LM Studio | Gestionnaire de modèles point et clic | Oui | Gratuit | Gratuit | Oui |
| Jan | Chat complètement hors ligne + backend | Oui | Gratuit | Gratuit | Oui |
| llama.cpp server | Contrôle brut, empreinte minimale | Oui (par processus) | Gratuit | Gratuit | Non |
| LiteLLM | Route vers 100+ backends | Routeur | Gratuit | Gratuit (cloud optionnel) | Interface Web |
| Open WebUI | Frontend multi-modèles de chat | Oui | Gratuit | Gratuit | Oui (web) |
| vLLM | Débit de niveau production | Oui (parallélisme tensoriel) | Gratuit | Gratuit | Non |
| Msty | Local + cloud dans une seule application | Oui (Split Chat) | Gratuit | 8,99 USD/mois | Oui |
Les applications
1. Ollama, le runtime par défaut
Ollama charge et décharge les modèles à la demande et expose une API compatible avec OpenAI sur le port 11434. Définissez OLLAMA_NUM_PARALLEL=2 et OLLAMA_MAX_LOADED_MODELS=3 dans votre environnement, redémarrez le service, et vous pouvez accéder à deux modèles en parallèle depuis n’importe quel client. Sur un M2 Pro avec 32 Go de mémoire unifiée, nous avons exécuté Qwen2.5-Coder 3B et Llama 3.2 3B côte à côte avec de la place pour un petit modèle de vision.
Où cela fait défaut : Pas d’interface graphique native. La longueur de contexte par défaut (2048) est petite pour le travail réel, alors ajustez-la. Le processus ollama serve n’épingle pas automatiquement les modèles à des GPU spécifiques sur les configurations multi-GPU.
Tarification :
- Gratuit : Tout.
Plateformes : macOS, Windows, Linux.
Conclusion : La couche de base. Presque tous les autres outils de cette liste enveloppent Ollama ou partagent son architecture. Installez-le en premier.
2. LM Studio, l’interface graphique polie
LM Studio est l’application que la plupart des gens installent en premier. Elle est dotée d’un navigateur de modèles complet, d’une interface de conversation et, depuis la version 0.3, d’un serveur local intégré qui exécute plusieurs modèles simultanément. Le catalogue des modèles est extrait directement de Hugging Face et filtré en fonction de ce qui s’adaptera à votre machine. Le mode Split Chat vous permet de comparer deux modèles sur la même invite en temps réel.
Où cela fait défaut : Pas open source (gratuit pour un usage personnel, contactez-les pour un usage commercial). La version llama.cpp incluse peut être en retard par rapport à l’upstream.
Tarification :
- Gratuit : Toutes les fonctionnalités pour un usage personnel.
- Payant : Contactez les ventes pour les licences d’équipe/commerciales.
Plateformes : Windows, macOS, Linux.
Télécharger : LM Studio
Conclusion : Le meilleur point d’entrée si vous voulez une interface graphique. Associez-le à Ollama pour les scripts.
3. Jan, l’LM Studio open-source
Jan est l’alternative open-source à LM Studio : la même idée, sous licence MIT, et l’objectif déclaré de fonctionner complètement hors ligne. Les fils de conversation multi-modèles permettent à chaque fil de s’épingler à un modèle différent. Il exécute son propre backend llama.cpp et peut faire un proxy vers un Ollama distant ou une API compatible avec OpenAI lorsque vous voulez un modèle plus important.
Où cela fait défaut : Projet plus jeune que LM Studio. Moins d’extensions packagées.
Tarification :
- Gratuit : Tout (open source).
Plateformes : Windows, macOS, Linux.
Conclusion : Choisissez ceci si l’open source est important. Fonctionnellement très similaire à LM Studio.
4. llama.cpp server, la primitive de base
llama.cpp est fourni avec un serveur HTTP sans état que vous lancez par modèle. Deux commandes shell, deux ports, deux modèles. C’est le moyen le plus serré de maintenir deux quantifications GGUF en RAM : pas de wrapper, pas de planificateur, pas de télémétrie, et le plus petit surcoût mémoire de tout ce qui se trouve ici.
Où cela fait défaut : Vous câblez votre propre routage. Pas d’interface graphique. Pas de gestionnaire de modèles. Uniquement la ligne de commande pour la configuration.
Tarification :
- Gratuit : Open source (MIT).
Plateformes : Windows, macOS, Linux (également Docker).
Télécharger : GitHub
Conclusion : Pour ceux qui veulent comprendre ce que cachent les couches d’abstraction. Parfait pour les configurations de scripts.
5. LiteLLM, le routeur
LiteLLM n’héberge pas les modèles ; il les achemine. Pointez vers votre instance Ollama, votre serveur LM Studio, votre clé API Anthropic et votre point de terminaison Azure, puis envoyez chaque demande via une URL compatible avec OpenAI et laissez le routeur décider. Un fichier de configuration YAML avec des basculements par modèle et des limites de débit permet à un assistant de codage de basculer vers un modèle local plus petit lorsque le grand est occupé.
Où cela fait défaut : Ajoute un processus supplémentaire à gérer. Le débogage des décisions de routage nécessite quelques lectures de journaux.
Tarification :
- Gratuit : Open source (proxy et SDK).
- Payant : LiteLLM Cloud (optionnel) basé sur abonnement pour l’observabilité.
Plateformes : Windows, macOS, Linux (Python, Docker).
Télécharger : GitHub
Conclusion : Le lien entre plusieurs runners. Ignorez si vous ne lancez qu’un backend, obligatoire si vous en lancez trois.
6. Open WebUI, l’interface type ChatGPT
Open WebUI est l’interface de conversation polie pour les modèles locaux. Connectez-la à Ollama (ou à n’importe quel point de terminaison compatible avec OpenAI), et elle vous offre l’authentification multi-utilisateurs, l’historique des conversations, la commutation de modèle en milieu de conversation et la comparaison côte à côte des modèles dans un seul onglet du navigateur. Utile pour un ménage où quatre personnes partagent une machine.
Où cela fait défaut : S’exécute dans Docker pour l’expérience fluide ; l’installation native est possible mais plus délicate. Utilise environ 500 Mo de RAM avant le chargement d’un modèle.
Tarification :
- Gratuit : Open source (BSD-3).
Plateformes : Windows, macOS, Linux (Docker).
Télécharger : GitHub
Conclusion : La meilleure interface si vous avez déjà Ollama en cours d’exécution. Le mode Split Chat est la fonctionnalité vedette.
7. vLLM, le moteur de débit
vLLM est ce que vous installez lorsque les outils desktop cessent de s’adapter. La gestion de la mémoire PagedAttention maintient plusieurs modèles avec une meilleure utilisation du VRAM que n’importe quel runner mono-modèle. Le parallélisme tensoriel divise un modèle entre les GPU ; plusieurs déploiements sur le même serveur hébergent différents modèles simultanément. Excessif pour un ordinateur portable, essentiel pour une station de travail avec deux GPU.
Où cela fait défaut : Linux en premier (Windows via WSL2). Nécessite Python et la configuration CUDA. Non destiné aux utilisateurs occasionnels.
Tarification :
- Gratuit : Open source (Apache 2.0).
Plateformes : Linux, Windows (WSL2), macOS (Apple Silicon partielle).
Télécharger : GitHub
Conclusion : N’atteignez ceci que si vous avez un GPU sérieux. Sur une seule RTX 4090, Ollama est plus facile et presque aussi rapide.
8. Msty, l’application desktop local + cloud
Msty est fourni comme un seul binaire desktop qui exécute des modèles locaux via un runtime intégré et des modèles cloud via vos propres clés API, côte à côte dans la même fenêtre. Split Chat compare jusqu’à quatre modèles par invite. La fonctionnalité Knowledge Stacks indexe les documents locaux et partage l’index entre les modèles.
Où cela fait défaut : Le niveau gratuit est généreux mais plafonne le split chat à deux modèles. Le niveau payant pour un split à quatre voies est du côté cher.
Tarification :
- Gratuit : Split chat bidirectionnel, toutes les fonctionnalités du modèle local.
- Payant : 8,99 USD/mois ou 79 USD/an pour un split à quatre voies et une synchronisation premium.
Plateformes : Windows, macOS, Linux.
Télécharger : Msty
Conclusion : Le moyen le plus facile de comparer les modèles locaux et cloud côte à côte. Payez pour cela uniquement si vous avez besoin d’un split à quatre voies.
Comment choisir le bon
- Si vous commencez à zéro, installez Ollama et Open WebUI. C’est la pile de référence.
- Si vous voulez une interface graphique sans toucher Docker, LM Studio ou Jan.
- Si l’open source est important et que vous voulez une interface graphique, Jan.
- Si vous routez entre des API locales et cloud, ajoutez LiteLLM.
- Si vous comparez constamment les sorties des modèles, Msty ou LM Studio Split Chat.
- Si vous écrivez des scripts pour tout, llama.cpp server sur des ports personnalisés.
- Si votre configuration a deux GPU et que vous servez une petite équipe, vLLM.
FAQ
Puis-je exécuter deux LLM sur un seul GPU ?
Oui, si les deux versions quantifiées tiennent dans le VRAM. Un modèle 3B à Q4_K_M utilise environ 2 Go ; deux d’entre eux tiennent confortablement sur une carte de 8 Go. Définissez OLLAMA_MAX_LOADED_MODELS à plus de 1 pour les garder au chaud.
Les petits LLM locaux sont-ils vraiment bons ?
Depuis Qwen 2.5 et Llama 3.2 dans la plage 3B-7B, les petits modèles traitent les résumés, la complétion de code, l’extraction et les conversations courtes avec une qualité proche de GPT-3.5. Ils échouent sur le raisonnement contextuel long et les tâches multi-étapes complexes. Contournez cela avec un modèle plus grand pour les invites difficiles.
Quelle est la différence entre Ollama et LM Studio ?
Ollama est un runtime CLI-first avec une API HTTP. LM Studio est une application desktop GUI-first qui exécute un serveur llama.cpp intégré. Ils peuvent s’exécuter en parallèle sur la même machine.
Ai-je besoin d’un GPU pour exécuter les LLM locaux ?
Non, mais cela aide. Un modèle 3B s’exécute à une vitesse lisible (10 à 20 tokens/seconde) sur un CPU Apple Silicon moderne ou une puce Intel/AMD avec 16 Go de RAM. Les GPU poussent cela à 60 à 200 tokens/seconde.
Quelle application s’exécute le plus rapidement ?
Par token, vLLM sur un GPU NVIDIA moderne. Par installation, llama.cpp avec une bonne quantification. Par commodité, Ollama.