Exécution de plusieurs modèles d'IA locaux sur bureau avec Ollama

Les meilleures applications pour exécuter plusieurs modèles d’IA locaux sur bureau sont celles qui arrêtent de traiter votre GPU comme une console de cartouche à fente unique. Un article XDA récent d’un auteur qui a arrêté de chasser les plus grands modèles locaux l’exprime clairement : deux modèles de 2 Go s’exécutant côte à côte ont surpassé un modèle de 8 Go, car chaque petit modèle a été choisi pour une tâche spécifique. Un modèle de code de 3B a géré l’autocomplétion. Un modèle de chat de 3B a géré la conversation. Aucun d’eux n’avait besoin d’être universel.

C’est le modèle qui nous intéresse ici. Pas la chasse aux benchmarks. Le routage. Nous avons testé sept exécuteurs et orchestrateurs de bureau au cours des dernières semaines, mesuré la vitesse à laquelle ils échangent les modèles, vérifié s’ils peuvent maintenir deux chargés à la fois, et évalué l’utilité du routage en pratique. Cette liste s’adresse à quiconque dispose d’une carte de 12 Go à 24 Go et souhaite un véritable assistant plus un modèle de code plus peut-être un modèle de vision, le tout sur une seule machine.

Ce qu’il faut rechercher dans un exécuteur multi-modèle local

Six choses distinguent les outils qui rendent les flux de travail multi-modèles agréables de ceux qui vous forcent dans une ornière de modèle unique.

Comparaison rapide

Application Mieux pour Plates-formes Forfait gratuit Niveau payant Histoire multi-modèle
Ollama Exécuteur fondamental et couche API Windows, macOS, Linux Entièrement gratuit, open source Aucun Échange à chaud à la demande, garde les modèles récents chauds
LM Studio GUI d’onglets multi-modèles Windows, macOS, Linux Gratuit pour usage personnel Licence d’équipe pour le travail Charger plusieurs modèles à la fois, changer d’onglets
Msty Chat parallèle entre modèles Windows, macOS, Linux Niveau gratuit Licence Aurum à vie Réponses côte à côte de jusqu’à huit modèles
Jan Client de chat multi-modèle open source Windows, macOS, Linux Entièrement gratuit, open source Aucun Échange par conversation, serveur compatible OpenAI
Open WebUI Couche de routage de pipeline sur Ollama Interface Web, auto-hébergé Entièrement gratuit, open source Aucun Sélection de modèle par demande, scripts de pipeline
LocalAI Routeur API clé en main Windows, macOS, Linux, Docker Entièrement gratuit, open source Aucun Un point de terminaison achemine vers de nombreux backends et formats
LiteLLM Proxy multi-backend Windows, macOS, Linux Entièrement gratuit, open source Niveau cloud géré Achemine par nom de modèle vers n’importe quel fournisseur local ou distant

Les applications

1. Ollama, meilleur pour l’échange à chaud des modèles locaux

Ollama est l’application sur laquelle dépend la plupart du reste de cette liste, et pour une bonne raison. Son CLI et son API autour de llama.cpp rendent la gestion des modèles comme docker pull, et son comportement avec plusieurs modèles est la raison pour laquelle les flux de travail à deux petits modèles fonctionnent en premier lieu. Exécutez ollama run llama3.2:3b pour le chat et ollama run qwen2.5-coder:3b pour l’autocomplétion, et le daemon garde le récemment utilisé chaud pendant qu’il en charge un autre. La durée de vie par défaut est de cinq minutes, donc un changement rapide ne paie pas la charge. Définissez OLLAMA_KEEP_ALIVE plus haut et le modèle reste résidant jusqu’à ce que la pression VRAM le force à l’expulsion.

Le point de terminaison compatible OpenAI à http://localhost:11434/v1 signifie que chaque extension IDE, interface de chat et framework d’agent que nous avons testé s’est connecté sans adaptateurs. Sur une carte de 24 Go, nous avons maintenu un modèle de chat de 7B et un modèle de code de 3B résidents ensemble avec de la place à revendre.

Où il tombe court : Pas d’interface graphique. La découverte de modèles est un fichier texte appelé Modelfile. La prise en charge du GPU Windows est stable depuis la version native, mais elle est toujours en retard sur macOS pour le polissage.

Tarification :

Plates-formes : Windows, macOS, Linux.

Télécharger : Site de l’éditeur - GitHub

Conclusion : Installez-le en premier. Même si votre application quotidienne est une application graphique, vous voudrez probablement Ollama comme backend.

2. LM Studio, meilleure interface graphique pour maintenir plusieurs modèles à la fois

LM Studio est l’application à remettre à un utilisateur sans CLI qui souhaite toujours la astuce des petits modèles. La série 0.3 a ajouté le support multi-modèles dans la même fenêtre, vous pouvez donc charger un modèle de chat dans un onglet, un modèle de code dans un autre, et basculer entre eux sans attendre le chargement à chaque fois. Le serveur intégré expose un point de terminaison compatible OpenAI par modèle chargé, ce qui signifie qu’une extension d’éditeur peut frapper le modèle de code tandis que votre fenêtre de chat continue de parler au modèle de chat.

La découverte de modèles est une boîte de recherche contre Hugging Face avec le sélecteur de quantification et l’estimateur VRAM intégrés. L’interface graphique montre les curseurs de déchargement GPU par modèle, ce qui est important lorsque vous essayez d’adapter deux modèles de taille moyenne sur une carte.

Où il tombe court : Pas open source. La licence gratuite couvre l’usage personnel, et il existe une licence séparée pour l’usage professionnel que le flux de téléchargement vous demande d’accepter. Certains formats de quantification se chargent plus lentement que dans le raw llama.cpp.

Tarification :

Plates-formes : Windows, macOS, Linux.

Télécharger : Site de l’éditeur - GitHub

Conclusion : Le meilleur choix si vous voulez une véritable interface graphique, plusieurs modèles chargés et un serveur API fonctionnant sans toucher un terminal.

3. Msty, meilleur pour le chat parallèle et la comparaison

Msty est l’application qui nous a fait arrêter les tests A/B des modèles par copier-coller. Son mode divisé vous permet d’envoyer un message à deux, quatre ou jusqu’à huit modèles à la fois et de lire les réponses côte à côte. C’est exactement le flux de travail que vous voulez quand vous essayez de déterminer quel petit modèle vaut la peine de garder chargé. Pointez-le vers Ollama et il hérite automatiquement de vos modèles locaux. Pointez-le vers les clés OpenAI ou Anthropic et comparez le local par rapport au hébergé dans la même vue.

La fonction Knowledge Stack vous permet de joindre des dossiers de documents et de PDF et de les interroger entre les modèles, ce qui s’associe bien avec un petit modèle de chat plus un petit modèle d’intégration conservés résidents ensemble.

Où il tombe court : Pas open source. Le niveau gratuit couvre l’usage personnel, et la mise à niveau Aurum déverrouille le chat divisé au-dessus de deux modèles, la synchronisation de l’espace de travail et quelques autres extras. L’interface graphique est riche en fonctionnalités et prend une session pour apprendre.

Tarification :

Plates-formes : Windows, macOS, Linux.

Télécharger : Site de l’éditeur

Conclusion : Choisissez ceci quand vous avez vraiment besoin de voir deux modèles répondre à la même question en même temps.

4. Jan, meilleur client de chat multi-modèle open source

Jan est l’alternative open source si vous voulez une interface graphique de style LM Studio sans la question de licence. Il est livré avec son propre moteur d’inférence, peut s’exécuter sur les serveurs Ollama ou llama.cpp, et vous permet d’échanger le modèle par conversation. Chaque fil se souvient du modèle, de l’indicateur système et des paramètres qu’il utilisait, donc un fil de code et un fil d’écriture peuvent pointer vers différents spécialistes sans se contaminer mutuellement.

Le serveur local intégré expose un point de terminaison compatible OpenAI, et l’application elle-même est extensible via une petite API d’extension. Dans nos tests, l’échange de modèles entre deux fils était quasi instantané quand la cible était déjà chargée et environ trois à huit secondes quand il fallait être chargé depuis le disque sur un NVMe.

Où il tombe court : Impossible de maintenir plusieurs modèles résidents dans son propre moteur pour le moment. Si vous voulez que deux soient chargés à la fois, pointez-le vers Ollama et laissez Ollama faire la gestion résidente. L’accélération GPU sur Windows est toujours en retard par rapport à la version macOS pour certains formats de quantification.

Tarification :

Plates-formes : Windows, macOS, Linux.

Télécharger : Site de l’éditeur - GitHub

Conclusion : Le bon choix si l’open source compte et que vous voulez le routage de modèle par fil sans travail CLI.

5. Open WebUI, meilleure couche de routage sur Ollama

Open WebUI était autrefois connu sous le nom d’Ollama WebUI, et reste l’interface web la plus complète pour une pile locale auto-hébergée. Ce qui le mérite ici, c’est son système de pipeline : vous pouvez définir des scripts qui choisissent le modèle par demande en fonction du contenu du message, de l’historique des messages ou des fichiers joints. L’exemple classique est un pipeline de routage qui envoie n’importe quoi commençant par un bloc de code à votre modèle de codeur et tout le reste à votre modèle de chat, le tout dans une conversation.

Il prend également en charge les réponses de modèles parallèles dans un seul message, plus RAG avec votre propre magasin de documents, plus les appels de fonction. Parce qu’il expose tout cela sur votre LAN, une boîte Ollama au sous-sol peut servir un chat multi-modèles routé à chaque machine de la maison.

Où il tombe court : D’abord le web. Il n’y a pas de client de bureau natif, vous exécutez donc localement dans un navigateur ou auto-hébergez sur un serveur. La configuration demande Docker ou Python, pas un installateur double-clic.

Tarification :

Plates-formes : Fonctionne partout où Docker ou Python s’exécute. Accès via le navigateur sur Windows, macOS, Linux.

Télécharger : Site de l’éditeur - GitHub

Conclusion : Utilisez-le quand vous voulez un routage programmable et que vous êtes à l’aise avec une installation Docker de cinq minutes.

6. LocalAI, meilleur routeur API clé en main entre les familles de modèles

LocalAI est la réponse à un problème spécifique. Vous avez un modèle de chat en GGUF, un modèle chuchotement pour la transcription, un modèle d’image pour la diffusion, et un petit modèle d’intégration, et vous voulez un point de terminaison qui parle compatible OpenAI pour tous. Il exécute chaque backend dans son propre worker, achemine les demandes par nom de modèle, et retourne les réponses dans la même forme qu’une API hébergée. Votre plugin Continue, votre outil de notes et votre script personnalisé pointent tous vers la même URL et sélectionnent leur modèle par nom.

Pour le modèle de deux petits modèles, cela signifie un flux de travail comme Continue demandant qwen-coder-3b tandis que votre application de notes demande llama-3.2-3b, tous deux servis à partir du même proxy, tous deux cargables à chaud, tous deux isolés pour qu’un travail d’intégration lourd ne arrête pas le chat.

Où il tombe court : La configuration est plus lourde qu’Ollama. La configuration du modèle est YAML par backend. L’accélération GPU fonctionne mais veut certaines connaissances de ce que vous avez installé. La documentation est complète mais suppose que vous savez déjà à quoi ressemble une charge compatible OpenAI.

Tarification :

Plates-formes : Windows, macOS, Linux, Docker.

Télécharger : Site de l’éditeur - GitHub

Conclusion : Le bon choix quand vous voulez une API locale qui parle au texte, la vision, l’audio et les intégrations sans coller les serveurs ensemble.

7. LiteLLM, meilleur proxy multi-backend pour le routage de tâches

LiteLLM a commencé comme un SDK Python pour appeler cent fournisseurs de modèles avec une interface, et son serveur proxy est ce qui le mérite ici sur une liste d’orientation locale. Exécutez-le devant Ollama, LM Studio, LocalAI, ou n’importe quel mélange, et les clients lui parlent avec une charge compatible OpenAI. Il réécrit la demande pour le backend derrière le nom de modèle demandé. Cela signifie un point de terminaison achemine chat vers votre Llama local et code vers votre Qwen Coder local, avec le même outil obtenant les deux sans savoir où chacun vit.

Il gère également les secours, les tentatives, les limites de débit et les budgets par clé, ce qui importe au moment où vous commencez à laisser plus d’une application partager votre GPU.

Où il tombe court : C’est un proxy, pas un exécuteur. Vous avez encore besoin d’Ollama ou LocalAI derrière pour servir réellement les modèles. La configuration est un fichier YAML. Le tableau de bord poli se trouve dans le niveau cloud géré, donc les auto-hébergeurs s’appuient sur l’interface graphique gratuite plus les fichiers de configuration.

Tarification :

Plates-formes : Windows, macOS, Linux, Docker.

Télécharger : Site de l’éditeur - GitHub

Conclusion : Ajoutez-le le jour où vous avez plus d’une application qui presse plus d’un modèle local et que vous voulez une source unique de vérité pour les noms, le routage et les limites.

Comment choisir le bon

Si vous voulez la configuration minimale pour la astuce des petits modèles, exécutez Ollama et c’est tout. Tirez un modèle de chat de 3B et un modèle de code de 3B, laissez le daemon garder l’un chaud pendant que vous utilisez l’autre, et pointez votre éditeur vers le point de terminaison local.

Si vous voulez une interface graphique et pas de terminal, installez LM Studio. Chargez deux modèles en deux onglets et utilisez son serveur intégré pour tout ce qui a besoin d’une API.

Si vous voulez vraiment comparer les modèles avant de vous engager VRAM, utilisez Msty et divisez le même message entre les candidats jusqu’à ce que l’un gagne.

Si vous voulez une interface graphique et open source, exécutez Jan au-dessus d’Ollama.

Si vous voulez router par contenu de message plutôt que par application, auto-hébergez Open WebUI devant Ollama et écrivez un pipeline.

Si votre charge de travail inclut la vision, la transcription ou les intégrations ainsi que le chat, mettez LocalAI au milieu et laissez une API servir tout.

Si vous avez déjà trois outils qui pressent deux modèles et c’est devenu désordre, déposez LiteLLM devant et renommez tout par rôle.

FAQ

Puis-je vraiment exécuter deux modèles d’IA locaux en même temps ?

Oui, sur n’importe quel GPU avec suffisamment de VRAM pour en contenir deux. Deux modèles quantifiés de 3B ou 4B s’adaptent confortablement sur une carte de 12 Go. Ollama et LM Studio peuvent les maintenir résidents, et les demandes à celui qui est inactif reviennent instantanément sans charge froide. L’article XDA qui a inspiré celui-ci en est un exemple fonctionnel, pas un théorique.

Un seul grand modèle d’IA local est-il toujours meilleur que deux petits ?

Non pour les flux de travail réels. Un seul modèle de 8B doit être un généraliste, ce qui signifie que c’est un codeur moyen et un écrivain moyen. Deux modèles de 3B choisis pour leur spécialisation (un modèle de codeur plus un modèle de chat, disons) battent souvent le modèle unique plus grand à chaque tâche spécialiste, surtout avec un routage correct. Le seul endroit où un modèle unique plus grand gagne toujours est le raisonnement profond sur une seule question difficile qui a besoin de contexte long.

Quelle est la meilleure application gratuite pour exécuter plusieurs modèles locaux sur le bureau ?

Ollama, pour le daemon et l’API. Ajoutez Jan ou Open WebUI au-dessus quand vous voulez une interface graphique ou un routage programmable. Les trois sont open source et gratuits sans limite de siège.

LM Studio vous permet-il d’exécuter deux modèles en même temps ?

Oui, depuis la série 0.3, il supporte le chargement de plusieurs modèles dans la même session avec des onglets, et le serveur compatible OpenAI intégré expose chaque modèle chargé comme un point de terminaison séparé. La limitation principale est VRAM.

Combien de VRAM ai-je besoin pour exécuter deux modèles d’IA locaux ?

Un minimum confortable pour deux modèles quantifiés de 3B ou 4B est 12 Go. Sur les cartes de 8 Go, vous pouvez à peine exécuter deux très petits modèles en Q4, mais vous perdrez de la place de concurrence. Pour un 7B plus un 3B maintenus résidents ensemble, prévoyez 16 Go et plus.

Quelle est la différence entre Ollama et LocalAI ?

Ollama est un exécuteur concentré autour de llama.cpp avec une CLI propre, un catalogue de modèles textuel et un point de terminaison compatible OpenAI. LocalAI est une couche API plus large qui peut servir de facade à de nombreux backends à la fois, y compris texte, image, audio et intégrations, avec config YAML par backend. Ollama est plus facile à démarrer. LocalAI est ce que vous atteignez une fois que votre flux de travail dépasse le chat.