Ollama — le serveur LLM local le plus populaire pour les laboratoires domestiques Proxmox

Chaque message envoyé à ChatGPT ou Claude quitte le bâtiment. Pour la plupart des gens, ce compromis convient. Pour un nombre croissant de propriétaires de laboratoires domestiques, ce n’est pas le cas, et un serveur Proxmox qui exécute déjà Plex, Home Assistant et Pi-hole dispose exactement du CPU, de la RAM et (souvent) du GPU dont un modèle de langage local a besoin. Un rapport récent d’un propriétaire d’hébergement personnel qui a abandonné l’IA cloud pour un LLM local sur Proxmox a bien résumé l’attrait : le matériel était déjà payé, donc le modèle est devenu ce qui a finalement fait que tout le laboratoire domestique en valait la peine. Nous avons rassemblé les sept applications qui valent la peine d’exécuter dans une VM ou un conteneur LXC pour y arriver, classées par effort de configuration, efficacité matérielle et à quel point l’expérience quotidienne se rapproche de ChatGPT. Ce sont les meilleures applications pour héberger un LLM local sur Proxmox cette année.

Quoi chercher dans un hôte LLM Proxmox

Tous les projets LLM locaux ne sont pas construits pour s’exécuter sans interface sur un hyperviseur. Quelques éléments séparent ceux qui valent la peine d’être installés de ceux qui vous combattront.

Comparaison rapide

Application Meilleur pour Déploiement Niveau gratuit Support GPU
Ollama Hôte Proxmox global Linux VM, LXC, Docker Gratuit, open-source NVIDIA, AMD (ROCm), CPU
Open WebUI Meilleure interface au-dessus d’Ollama Docker sur la même VM/LXC Gratuit, open-source Hérite du GPU backend
LM Studio Découverte de modèles sur le bureau Application de bureau (pas sans interface) Gratuit NVIDIA, Apple Silicon
text-generation-webui Formats de modèles avancés et plus anciens Linux VM, Docker Gratuit, open-source NVIDIA, AMD, CPU
vLLM Service haute performance, production Linux VM, Docker Gratuit, open-source NVIDIA (meilleur), AMD (partiel)
llama.cpp server Le plus léger, GGUF natif Linux VM, LXC, Docker Gratuit, open-source NVIDIA, AMD, Apple Silicon, CPU
LocalAI Remplacement drop-in OpenAI-API Linux VM, LXC, Docker Gratuit, open-source NVIDIA, CPU

Les 7 applications classées

1. Ollama — Meilleur globalement

Ollama est l’application sur laquelle la plupart des propriétaires de laboratoires domestiques Proxmox atterrissent en premier, et généralement celle avec laquelle ils restent. L’installation est une seule commande shell à l’intérieur d’une VM Debian ou Ubuntu (ou un conteneur LXC privilégié avec les bons modules de noyau), et extraire un modèle est aussi simple que ollama run llama3. Il expose une API compatible avec OpenAI sur le port 11434 par défaut, ce qui signifie que Home Assistant, Continue.dev et des dizaines d’autres outils s’y connectent sans configuration supplémentaire.

Où il est défaillant: L’interface groupée est un chat en ligne de commande, pas une interface Web, la plupart des gens l’associent donc avec Open WebUI ou une interface frontale similaire. Le passage du GPU dans un conteneur LXC nécessite que le pilote NVIDIA corresponde exactement entre l’hôte et le conteneur, ce qui dérange les novices plus que l’itinéraire de la VM.

Tarification: Gratuit, open-source.

Plates-formes: Linux VM, LXC, Docker, également natif sur Windows et macOS pour les tests locaux en dehors du laboratoire.

Télécharger: ollama.com

Ligne de fond: Le choix par défaut pour un hôte LLM Proxmox, et le backend sur lequel la plupart des autres applications de cette liste sont construites.

2. Open WebUI — Meilleure interface au-dessus d’Ollama

Open WebUI transforme Ollama en quelque chose qui ressemble vraiment et ressemble à ChatGPT : historique de conversation, conversations multiples, changement de modèle à partir d’un menu déroulant, téléchargement de documents avec réponses améliorées par recherche, et connexions multi-utilisateurs avec permissions par utilisateur. Il s’exécute dans son propre conteneur Docker juste à côté d’Ollama, de sorte que les deux ensemble s’intègrent confortablement dans un conteneur LXC ou une petite VM.

Les déploiements familiaux ou ménagers bénéficient le plus ici. Chaque personne obtient sa propre connexion, son propre historique de conversation, et un administrateur peut définir quels modèles sont disponibles pour qui.

Où il est défaillant: C’est une interface, pas un serveur de modèles, donc elle dépend entièrement d’Ollama (ou d’un autre backend compatible avec OpenAI) déjà en cours d’exécution dessous. Les écrans de gestion des autorisations et des utilisateurs prennent quelques minutes pour s’y habituer la première fois.

Tarification: Gratuit, open-source.

Plates-formes: Docker sur une VM Linux ou un conteneur LXC, aux côtés d’Ollama.

Télécharger: github.com/open-webui/open-webui

Ligne de fond: Le choix pour quiconque veut que le ménage utilise réellement le LLM local au lieu de seulement la personne qui l’a configuré.

3. LM Studio — Meilleur pour la découverte de modèles

LM Studio est une application de bureau soignée pour Windows, macOS et Linux qui rend la navigation, le téléchargement et les tests des modèles Hugging Face indolore, avec un catalogue intégré, des estimations de RAM et VRAM avant le téléchargement, et un mode serveur local qui expose la même API compatible avec OpenAI que les autres applications de cette liste. C’est moins natif de Proxmox qu’Ollama, car il est conçu pour s’exécuter avec un GUI sur un poste de travail plutôt que sans interface dans un conteneur, mais il mérite une place ici car c’est le moyen le plus rapide de savoir quel modèle s’adapte réellement à votre matériel avant de s’engager dans un déploiement Proxmox.

Certains propriétaires de laboratoires domestiques exécutent LM Studio sur une machine de bureau uniquement pour la recherche de modèles, puis extraient le modèle gagnant dans Ollama sur la boîte Proxmox pour le serveur toujours actif.

Où il est défaillant: L’exécuter sans interface à l’intérieur d’une VM fonctionne mais perd le sens de l’application, car le GUI est l’attrait principal. Il n’est pas conçu pour le type d’opération sans surveillance, démarrage et oubli qu’un serveur de laboratoire domestique souhaite.

Tarification: Gratuit.

Plates-formes: Bureau Windows, macOS, Linux (pas natif du conteneur).

Télécharger: lmstudio.ai

Ligne de fond: Utile comme outil de reconnaissance avant le déploiement, pas comme hôte Proxmox lui-même.

4. text-generation-webui — Meilleur pour les formats de modèles avancés et plus anciens

text-generation-webui, souvent appelé « oobabooga » d’après son créateur, est le vétéran de cette liste et reste toujours l’application avec le plus large support de format : GGUF, GPTQ, AWQ et EXL2 se chargent tous via la même interface, ainsi que le support de réglage fin LoRA et un mode d’achèvement de style bloc-notes. Pour quiconque exécute un modèle plus ancien ou plus obscur pour lequel les outils plus récents ont arrêté le support, c’est généralement où il fonctionne encore.

L’interface Web comprend les cartes de personnages, les présets de chat et les extensions pour des choses comme la mémoire à long terme et la voix, les fonctionnalités plus ciblées sur l’expérimentation de loisir que sur une expérience de chat propre et quotidienne.

Où il est défaillant: L’interface montre son âge à côté d’Open WebUI, et le grand nombre de paramètres et d’extensions peut submerger quelqu’un qui veut juste une boîte de chat fonctionnelle. Les mises à jour cassent occasionnellement la compatibilité avec des formats de quantification spécifiques.

Tarification: Gratuit, open-source.

Plates-formes: Linux VM, Docker, également exécuté sur Windows et macOS.

Télécharger: github.com/oobabooga/text-generation-webui

Ligne de fond: Le bon choix pour les bricoleurs exécutant des formats de modèles inhabituels ou des réglages fins que d’autres serveurs ne supportent pas.

5. vLLM — Meilleur pour la haute performance et le service de production

vLLM est construit pour un problème différent de la plupart de cette liste : servir de nombreuses demandes concurrentes rapidement, en utilisant PagedAttention pour garder la mémoire GPU efficace sous charge. Sur une boîte Proxmox avec un GPU correctement transmis, vLLM dépassera largement Ollama quand plusieurs personnes ou plusieurs applications frappent le modèle à la fois, ce qui compte pour un laboratoire domestique exécutant un LLM derrière plusieurs services (assistant de codage, interface de chat et pipeline d’automatisation, tous en même temps).

Il parle nativement l’API OpenAI, il s’intègre donc dans les mêmes outils qui parlent à Ollama.

Où il est défaillant: La configuration est plus lourde, les exigences GPU sont plus strictes, et les performances de conversation utilisateur unique ne sont pas significativement meilleures que les options plus simples ici. Les laboratoires domestiques CPU uniquement ou à faible VRAM en tirent peu d’avantages.

Tarification: Gratuit, open-source.

Plates-formes: Linux VM avec passage GPU, Docker.

Télécharger: github.com/vllm-project/vllm

Ligne de fond: Overkill pour un remplacement ChatGPT utilisateur unique, mais le bon outil une fois qu’un laboratoire domestique commence à servir un modèle local à plusieurs applications ou personnes à la fois.

6. llama.cpp server — Le plus léger, GGUF natif

llama.cpp est le moteur d’inférence C++ que la plupart des applications de cette liste exécutent sous le capot, et son propre serveur groupé (llama-server) est le moyen le plus léger d’exposer un modèle GGUF sur une API compatible avec OpenAI sans aucune couche supplémentaire. L’utilisation des ressources est la plus faible de cette liste, ce qui en fait un choix solide pour un petit conteneur LXC ou un hôte Proxmox qui doit également exécuter d’autres services sur le même matériel.

Il comprend une interface de chat Web intégrée minimale, fonctionnelle mais simple, qui suffit pour une utilisation basique sans ajouter Open WebUI dessus.

Où il est défaillant: Pas de gestionnaire de modèles, pas de comptes multi-utilisateurs, et la configuration s’effectue via les drapeaux de ligne de commande plutôt qu’un écran de paramètres. Cela récompense quelqu’un à l’aise avec un terminal plus que quelqu’un qui veut une configuration pointer-cliquer.

Tarification: Gratuit, open-source.

Plates-formes: Linux VM, LXC, Docker, également construit sur Windows, macOS et Apple Silicon.

Télécharger: github.com/ggerganov/llama.cpp

Ligne de fond: Le choix pour adapter un modèle au matériel minimal ou à un conteneur LXC aux ressources limitées.

7. LocalAI — Meilleur remplacement drop-in OpenAI-API

LocalAI vise à être un remplacement drop-in presque total pour l’API OpenAI, couvrant non seulement les complétions de chat mais la génération d’images, la synthèse vocale et les incorporations derrière la même interface. Pour un laboratoire domestique qui a déjà des applications ou des automations connectées pour appeler l’API OpenAI, LocalAI permet à ce point d’intégration de rester inchangé tandis que l’inférence réelle se produit localement sur la boîte Proxmox.

Il supporte une large gamme de backends, y compris llama.cpp, de sorte que le même serveur peut exécuter plusieurs formats de modèle différents selon ce qu’une demande donnée nécessite.

Où il est défaillant: La largeur des types de modèles pris en charge ajoute une complexité de configuration par rapport à un serveur monofonction comme Ollama, et le projet se déplace suffisamment rapidement pour que la documentation reste occasionnellement à la traîne de la dernière version.

Tarification: Gratuit, open-source.

Plates-formes: Linux VM, LXC, Docker.

Télécharger: localai.io

Ligne de fond: Le bon choix quand les outils existants sont déjà construits contre l’API OpenAI et que le remplacement du point de terminaison, et non la réécriture de l’intégration, est l’objectif.

Comment choisir le bon

Pour une personne remplaçant ChatGPT pour un usage quotidien, Ollama associé à Open WebUI couvre presque tout : une interface de chat, le changement de modèle et un point de terminaison API pour n’importe quoi d’autre sur le réseau. Un ménage partageant une boîte Proxmox bénéficie du même appairage, puisque les connexions par utilisateur d’Open WebUI gardent les historiques de conversation séparés sans besoin de plusieurs VM.

Un hobbyiste qui veut bidouiller les réglages fins, les présets de caractères ou les formats de quantification plus anciens tire plus de profit de text-generation-webui, même avec sa courbe d’apprentissage plus raide. Quelqu’un qui décide encore quel modèle s’adapte à son matériel devrait commencer par LM Studio sur un bureau avant de s’engager à une VM Proxmox dans une configuration spécifique.

Un rig riche en GPU servant plusieurs applications ou utilisateurs à la fois est le seul cas où vLLM mérite son coût de configuration supplémentaire, car son avantage de débit ne se montre que sous charge concurrente. Une boîte CPU uniquement ou un hôte Proxmox avec RAM limité à économiser est mieux servi par le serveur llama.cpp directement, qui porte le moins d’surcharge de n’importe quoi sur cette liste. Et un laboratoire avec une automatisation existante appelant déjà l’API OpenAI est l’un des cas clairs pour LocalAI, car cela permet à ce point d’intégration de rester exactement comme il était.

Questions fréquemment posées

Proxmox peut-il exécuter des LLM sans GPU? Oui. Ollama, serveur llama.cpp et LocalAI s’exécutent tous sur CPU uniquement, et un modèle 7B ou 8B quantifié est utilisable pour le chat sur un CPU multicœur moderne, bien que les réponses arrivent notablement plus lentement que sur un GPU. Les modèles quantifiés plus petits (3B et moins) restent réactifs même sur du matériel modeste.

Quel LLM local est le plus proche de la qualité ChatGPT? La qualité du modèle dépend de quels poids sont chargés, pas quel serveur les exécute, donc l’une de ces applications peut exécuter les mêmes modèles. Les grands modèles ouverts dans la gamme 70B-plus, exécutés dans une bonne quantification, se rapprochent le plus des réponses au niveau de ChatGPT, bien qu’ils nécessitent une VRAM substantielle ou une solution de secours CPU lente pour fonctionner correctement.

Ollama est-il gratuit? Oui. Ollama est gratuit et open-source, sans niveau payant, abonnement ou limites d’utilisation, car l’inférence se fait entièrement sur le matériel sur lequel elle s’exécute.

Dois-je utiliser une VM ou un conteneur LXC pour Ollama? Un conteneur LXC est plus léger et démarre plus rapidement, ce qui convient à une configuration CPU uniquement ou à un laboratoire serré en RAM. Une VM est le choix le plus sûr pour le passage du GPU, car elle isole la pile de pilotes NVIDIA du host Proxmox et évite les problèmes de correspondance de version qui surviennent quand un conteneur partage le noyau et les pilotes du host.

Quel modèle s’exécute sur 16 GB VRAM? Un modèle 13B dans une quantification GGUF 4 bits ou 5 bits s’adapte confortablement dans 16 GB de VRAM avec de la place pour une fenêtre de contexte raisonnable. Certaines quantifications 34B bien optimisées s’adaptent également avec une longueur de contexte réduite, bien que 13B et moins donne la plus grande marge pour les conversations plus longues.