
Gemma 4 sur un ordinateur portable est réactif. Le GPU fait son travail, les réponses arrivent en secondes, et le modèle se sent comme un véritable assistant. Déplacez-le sur un NAS et il ralentira assez pour qu’une question devienne un petit engagement. C’est cette différence qui compte. Quand le modèle se trouve sur un stockage partagé, toute la famille ou l’équipe peut l’appeler, et la latence supplémentaire d’une seconde le redevient un outil au lieu d’un réflexe.
Nous avons choisi huit applications que nous exécutons sur un NAS pour héberger des LLM locaux aujourd’hui. Certaines sont le serveur, certaines sont le front-end, certaines sont la couche de déploiement. Ensemble, elles couvrent le flux de travail allant du téléchargement d’un modèle à une famille de clients appelant un point de terminaison partagé.
Ce qu’il faut chercher dans une application LLM hébergée sur NAS
- Fonctionne sans interface. Un NAS n’a pas de moniteur et souvent pas de GPU.
- Expose une API HTTP stable pour que n’importe quel client puisse communiquer avec.
- Gère les modèles sans réempaqueter une image Docker.
- Diffuse les tokens, car un modèle hébergé sur NAS est plus lent et la diffusion le rend utilisable.
- Une couche de contrôle d’accès, même un simple token, car le point de terminaison se trouve sur le LAN.
Les huit ci-dessous répondent à au moins quatre des cinq critères. Le classement les ordonne par facilité d’exécution sur Synology, QNAP ou un NAS auto-construit.
Comparaison rapide
| Application | Meilleur pour | Fonctionne sur | Support GPU | Licence |
|---|---|---|---|---|
| Ollama | Le serveur NAS le plus facile | Linux, macOS, Windows | CUDA, Metal, ROCm | MIT |
| LM Studio | Hôte de modèle pointer-cliquer | Linux, macOS, Windows | CUDA, Metal, ROCm | Proprietary (free) |
| Open WebUI | Front-end web partagé | Docker | Via le backend | MIT |
| LocalAI | Drop-in compatible OpenAI | Docker | CUDA, ROCm, CPU | MIT |
| Text Generation WebUI | Réglage des utilisateurs avancés | Linux, macOS, Windows | CUDA, ROCm, CPU | AGPL |
| Jan | Client bureau local-first | Windows, macOS, Linux | CUDA, Metal, CPU | AGPL |
| vLLM | Inférence haute débit | Linux | CUDA (serveurs GPU) | Apache 2 |
| llama.cpp | Inférence CPU bare-metal | Tous | Tous | MIT |
1. Ollama, meilleur pour le serveur NAS le plus facile
Ollama est la chose la plus proche d’une installation en une seule commande pour un NAS. Image Docker, port 11434, et chaque client qui parle Ollama ou l’API OpenAI peut communiquer avec lui. La bibliothèque de modèles couvre Llama, Gemma, Mistral, Qwen, et une liste croissante de variantes instruct.
Où il est insuffisant : les contrôles d’échantillonnage granulaire sont cachés derrière des drapeaux. Quiconque veut permuter les modèles de requête à la main finit par utiliser la syntaxe modelfile.
Tarification :
- Gratuit, MIT.
Plateformes : Linux, macOS, Windows (tous en Docker ou en natif).
Télécharger : ollama.com
Conclusion : La recommandation par défaut pour quiconque met en place un LLM NAS pour la première fois.
2. LM Studio, meilleur pour un hôte de modèle pointer-cliquer
LM Studio est l’application de bureau qui exécute également un serveur compatible OpenAI. Pointez-la vers un dossier de modèles montés sur NAS, activez le serveur, et les clients sur le LAN peuvent l’appeler. L’interface cache les parties de llama.cpp qui effrayent les gens.
Où il est insuffisant : c’est une application de bureau en premier lieu, donc l’installation sans tête sur un NAS signifie l’exécuter dans un serveur X léger ou choisir un NAS avec écran pour la configuration.
Tarification :
- Gratuit pour un usage personnel.
Plateformes : Windows, macOS, Linux.
Télécharger : lmstudio.ai
Conclusion : Le bon choix quand un membre de la famille veut changer de modèles et ne veut pas toucher au terminal.
3. Open WebUI, meilleur pour un front-end web partagé
Open WebUI est l’interface web de style ChatGPT pour un backend hébergé sur NAS. Pointez-la vers Ollama, LM Studio ou LocalAI, ajoutez des utilisateurs, et chaque membre du ménage obtient ses propres conversations et une bibliothèque partagée d’invites. RAG sur fichiers locaux est livré dans la boîte.
Où il est insuffisant : c’est un front-end, pas un runtime. Ollama ou LocalAI fait toujours le travail du modèle.
Tarification :
- Gratuit, MIT.
Plateformes : Docker sur Linux, plus une installation NAS native via Portainer.
Télécharger : openwebui.com
Conclusion : L’appairage correct avec Ollama quand l’objectif est un chat familial partagé et centré sur le navigateur.
4. LocalAI, meilleur pour drop-in compatible OpenAI
LocalAI expose un point de terminaison compatible OpenAI (chat, embeddings, images, TTS) par rapport aux modèles locaux. N’importe quelle application qui parle l’API OpenAI peut communiquer avec sans modifications. Les backends couvrent llama.cpp, whisper.cpp et stable-diffusion.cpp.
Où il est insuffisant : le fichier de configuration est dense et chaque modèle a besoin de sa propre entrée. Ollama gère la cartographie pour vous.
Tarification :
- Gratuit, MIT.
Plateformes : Docker sur Linux, plus builds natifs pour Windows et macOS.
Télécharger : localai.io
Conclusion : Le serveur correct quand le client est un SDK OpenAI et changer l’URL de base est toute la migration.
5. Text Generation WebUI, meilleur pour réglage des utilisateurs avancés
Text Generation WebUI (oobabooga) est le front-end plus ancien et plus riche qui exécute également un serveur. Les paramètres d’échantillonnage, le chargement LoRA et les modèles d’invite de style fiche de personnage sont tous exposés. Quiconque veut régler un modèle au-delà du défaut s’asseoit ici.
Où il est insuffisant : l’interface a été reconstruite deux fois et montre toujours ses racines d’utilisateur avancé. Ce n’est pas l’outil que vous remettez à un membre de la famille.
Tarification :
- Gratuit, AGPL.
Plateformes : Windows, macOS, Linux.
Télécharger : github.com/oobabooga/text-generation-webui
Conclusion : Le choix pour quiconque veut les boutons d’échantillonnage que Ollama et LM Studio cachent.
6. Jan, meilleur pour client bureau local-first
Jan est le client ChatGPT local-first. Il est livré avec son propre runtime pour les NAS uniquement CPU, mais parle également à un serveur Ollama ou LocalAI distant. Les conversations et les invites restent sur disque, donc toute l’historique est un fichier local.
Où il est insuffisant : en tant que serveur NAS, ce n’est pas le meilleur ajustement. Utilisez-le comme client et laissez Ollama ou LocalAI faire la mise en place.
Tarification :
- Gratuit, AGPL.
Plateformes : Windows, macOS, Linux.
Télécharger : jan.ai
Conclusion : Le compagnon de bureau correct pour un serveur NAS pour quiconque ne veut pas d’onglet web.
7. vLLM, meilleur pour inférence haute débit
vLLM est le serveur au niveau de la production. L’attention par page, le parallélisme des tenseurs et le regroupement continu le font être le moyen le plus rapide de servir un grand modèle à de nombreux clients. Le truc c’est qu’il a besoin d’un vrai GPU (Ampere ou plus récent).
Où il est insuffisant : ce n’est pas une installation adaptée au NAS. Un châssis NAS sans GPU de centre de données ne peut pas l’exécuter de la manière que les documents supposent.
Tarification :
- Gratuit, Apache 2.
Plateformes : Linux (généralement Docker avec toolkit conteneur NVIDIA).
Télécharger : github.com/vllm-project/vllm
Conclusion : Le choix quand le “NAS” est une boîte Linux avec un vrai GPU servant un laboratoire de clients à domicile.
8. llama.cpp, meilleur pour inférence CPU bare-metal
llama.cpp est le runtime de bas niveau que tout le reste de cette liste enveloppe. Il s’exécute sur les builds NAS uniquement CPU où un vrai GPU est absent, avec des modèles quantifiés qui réduisent un modèle de 8B paramètres à quelques gigaoctets.
Où il est insuffisant : il n’y a pas d’interface. C’est un binaire serveur et CLI. Associez-le avec Open WebUI ou Ollama.
Tarification :
- Gratuit, MIT.
Plateformes : Tous (Linux, macOS, Windows, ARM y compris Raspberry Pi et Apple Silicon).
Télécharger : github.com/ggerganov/llama.cpp
Conclusion : Le bon choix quand le NAS est uniquement CPU et chaque gigaoctet de RAM compte.
Comment choisir le bon
- Installation en une commande sur un NAS : Ollama.
- Chat web partagé pour le ménage : Ollama plus Open WebUI.
- Point de terminaison compatible OpenAI que n’importe quel SDK peut appeler : LocalAI.
- Échange de modèle pointer-cliquer : LM Studio.
- Contrôle d’échantillonnage et LoRA : Text Generation WebUI.
- Client bureau local pointant vers un NAS : Jan.
- Débit GPU sérieux pour de nombreux clients : vLLM.
- NAS uniquement CPU : llama.cpp.
FAQ
Quel modèle fonctionne sur un NAS sans GPU?
Les versions quantifiées de Gemma, Llama ou Mistral dans la plage 3B-8B s’exécutent sur un CPU NAS moderne à quelques tokens par seconde. C’est lent pour le chat interactif, bien pour un résumé unique ou un travail de nuit.
Ai-je besoin d’une GPU sur mon NAS?
Seulement pour la vitesse interactive. Un NAS uniquement CPU exécute toujours un petit modèle ; les temps de réponse sont de quelques secondes par phrase au lieu de tokens par seconde.
Puis-je garder le modèle hébergé sur NAS privé sur mon LAN?
Oui. Ollama, LM Studio et LocalAI se lient à l’interface LAN par défaut. Ajoutez une auth de base ou un proxy inverse pour quelque chose de plus qu’un LAN domestique.
Combien d’espace disque les modèles locaux ont-ils besoin?
Un modèle quantifié 8B se situe autour de 5 GB. Un modèle quantifié 70B se situe plus près de 40 GB. Un NAS avec un volume de rechange de 500 GB contient une bibliothèque complète.
Plusieurs personnes peuvent-elles utiliser le modèle en même temps?
Ollama, LocalAI et Text Generation WebUI sérialisent tous par défaut. vLLM gère les requêtes concurrentes nativement. Pour une petite famille, la sérialisation va bien.
Qu’en est-il de la confidentialité?
Chaque application de cette liste exécute le modèle localement. Aucune invite ou réponse n’est envoyée à un tiers à moins que l’application ne soit configurée pour le faire.