Ollama, l'une des applications utilisées pour exécuter des LLM locaux sur un NAS

Gemma 4 sur un ordinateur portable est réactif. Le GPU fait son travail, les réponses arrivent en secondes, et le modèle se sent comme un véritable assistant. Déplacez-le sur un NAS et il ralentira assez pour qu’une question devienne un petit engagement. C’est cette différence qui compte. Quand le modèle se trouve sur un stockage partagé, toute la famille ou l’équipe peut l’appeler, et la latence supplémentaire d’une seconde le redevient un outil au lieu d’un réflexe.

Nous avons choisi huit applications que nous exécutons sur un NAS pour héberger des LLM locaux aujourd’hui. Certaines sont le serveur, certaines sont le front-end, certaines sont la couche de déploiement. Ensemble, elles couvrent le flux de travail allant du téléchargement d’un modèle à une famille de clients appelant un point de terminaison partagé.

Ce qu’il faut chercher dans une application LLM hébergée sur NAS

Les huit ci-dessous répondent à au moins quatre des cinq critères. Le classement les ordonne par facilité d’exécution sur Synology, QNAP ou un NAS auto-construit.

Comparaison rapide

Application Meilleur pour Fonctionne sur Support GPU Licence
Ollama Le serveur NAS le plus facile Linux, macOS, Windows CUDA, Metal, ROCm MIT
LM Studio Hôte de modèle pointer-cliquer Linux, macOS, Windows CUDA, Metal, ROCm Proprietary (free)
Open WebUI Front-end web partagé Docker Via le backend MIT
LocalAI Drop-in compatible OpenAI Docker CUDA, ROCm, CPU MIT
Text Generation WebUI Réglage des utilisateurs avancés Linux, macOS, Windows CUDA, ROCm, CPU AGPL
Jan Client bureau local-first Windows, macOS, Linux CUDA, Metal, CPU AGPL
vLLM Inférence haute débit Linux CUDA (serveurs GPU) Apache 2
llama.cpp Inférence CPU bare-metal Tous Tous MIT

1. Ollama, meilleur pour le serveur NAS le plus facile

Ollama est la chose la plus proche d’une installation en une seule commande pour un NAS. Image Docker, port 11434, et chaque client qui parle Ollama ou l’API OpenAI peut communiquer avec lui. La bibliothèque de modèles couvre Llama, Gemma, Mistral, Qwen, et une liste croissante de variantes instruct.

Où il est insuffisant : les contrôles d’échantillonnage granulaire sont cachés derrière des drapeaux. Quiconque veut permuter les modèles de requête à la main finit par utiliser la syntaxe modelfile.

Tarification :

Plateformes : Linux, macOS, Windows (tous en Docker ou en natif).

Télécharger : ollama.com

Conclusion : La recommandation par défaut pour quiconque met en place un LLM NAS pour la première fois.

2. LM Studio, meilleur pour un hôte de modèle pointer-cliquer

LM Studio est l’application de bureau qui exécute également un serveur compatible OpenAI. Pointez-la vers un dossier de modèles montés sur NAS, activez le serveur, et les clients sur le LAN peuvent l’appeler. L’interface cache les parties de llama.cpp qui effrayent les gens.

Où il est insuffisant : c’est une application de bureau en premier lieu, donc l’installation sans tête sur un NAS signifie l’exécuter dans un serveur X léger ou choisir un NAS avec écran pour la configuration.

Tarification :

Plateformes : Windows, macOS, Linux.

Télécharger : lmstudio.ai

Conclusion : Le bon choix quand un membre de la famille veut changer de modèles et ne veut pas toucher au terminal.

3. Open WebUI, meilleur pour un front-end web partagé

Open WebUI est l’interface web de style ChatGPT pour un backend hébergé sur NAS. Pointez-la vers Ollama, LM Studio ou LocalAI, ajoutez des utilisateurs, et chaque membre du ménage obtient ses propres conversations et une bibliothèque partagée d’invites. RAG sur fichiers locaux est livré dans la boîte.

Où il est insuffisant : c’est un front-end, pas un runtime. Ollama ou LocalAI fait toujours le travail du modèle.

Tarification :

Plateformes : Docker sur Linux, plus une installation NAS native via Portainer.

Télécharger : openwebui.com

Conclusion : L’appairage correct avec Ollama quand l’objectif est un chat familial partagé et centré sur le navigateur.

4. LocalAI, meilleur pour drop-in compatible OpenAI

LocalAI expose un point de terminaison compatible OpenAI (chat, embeddings, images, TTS) par rapport aux modèles locaux. N’importe quelle application qui parle l’API OpenAI peut communiquer avec sans modifications. Les backends couvrent llama.cpp, whisper.cpp et stable-diffusion.cpp.

Où il est insuffisant : le fichier de configuration est dense et chaque modèle a besoin de sa propre entrée. Ollama gère la cartographie pour vous.

Tarification :

Plateformes : Docker sur Linux, plus builds natifs pour Windows et macOS.

Télécharger : localai.io

Conclusion : Le serveur correct quand le client est un SDK OpenAI et changer l’URL de base est toute la migration.

5. Text Generation WebUI, meilleur pour réglage des utilisateurs avancés

Text Generation WebUI (oobabooga) est le front-end plus ancien et plus riche qui exécute également un serveur. Les paramètres d’échantillonnage, le chargement LoRA et les modèles d’invite de style fiche de personnage sont tous exposés. Quiconque veut régler un modèle au-delà du défaut s’asseoit ici.

Où il est insuffisant : l’interface a été reconstruite deux fois et montre toujours ses racines d’utilisateur avancé. Ce n’est pas l’outil que vous remettez à un membre de la famille.

Tarification :

Plateformes : Windows, macOS, Linux.

Télécharger : github.com/oobabooga/text-generation-webui

Conclusion : Le choix pour quiconque veut les boutons d’échantillonnage que Ollama et LM Studio cachent.

6. Jan, meilleur pour client bureau local-first

Jan est le client ChatGPT local-first. Il est livré avec son propre runtime pour les NAS uniquement CPU, mais parle également à un serveur Ollama ou LocalAI distant. Les conversations et les invites restent sur disque, donc toute l’historique est un fichier local.

Où il est insuffisant : en tant que serveur NAS, ce n’est pas le meilleur ajustement. Utilisez-le comme client et laissez Ollama ou LocalAI faire la mise en place.

Tarification :

Plateformes : Windows, macOS, Linux.

Télécharger : jan.ai

Conclusion : Le compagnon de bureau correct pour un serveur NAS pour quiconque ne veut pas d’onglet web.

7. vLLM, meilleur pour inférence haute débit

vLLM est le serveur au niveau de la production. L’attention par page, le parallélisme des tenseurs et le regroupement continu le font être le moyen le plus rapide de servir un grand modèle à de nombreux clients. Le truc c’est qu’il a besoin d’un vrai GPU (Ampere ou plus récent).

Où il est insuffisant : ce n’est pas une installation adaptée au NAS. Un châssis NAS sans GPU de centre de données ne peut pas l’exécuter de la manière que les documents supposent.

Tarification :

Plateformes : Linux (généralement Docker avec toolkit conteneur NVIDIA).

Télécharger : github.com/vllm-project/vllm

Conclusion : Le choix quand le “NAS” est une boîte Linux avec un vrai GPU servant un laboratoire de clients à domicile.

8. llama.cpp, meilleur pour inférence CPU bare-metal

llama.cpp est le runtime de bas niveau que tout le reste de cette liste enveloppe. Il s’exécute sur les builds NAS uniquement CPU où un vrai GPU est absent, avec des modèles quantifiés qui réduisent un modèle de 8B paramètres à quelques gigaoctets.

Où il est insuffisant : il n’y a pas d’interface. C’est un binaire serveur et CLI. Associez-le avec Open WebUI ou Ollama.

Tarification :

Plateformes : Tous (Linux, macOS, Windows, ARM y compris Raspberry Pi et Apple Silicon).

Télécharger : github.com/ggerganov/llama.cpp

Conclusion : Le bon choix quand le NAS est uniquement CPU et chaque gigaoctet de RAM compte.

Comment choisir le bon

FAQ

Quel modèle fonctionne sur un NAS sans GPU?

Les versions quantifiées de Gemma, Llama ou Mistral dans la plage 3B-8B s’exécutent sur un CPU NAS moderne à quelques tokens par seconde. C’est lent pour le chat interactif, bien pour un résumé unique ou un travail de nuit.

Ai-je besoin d’une GPU sur mon NAS?

Seulement pour la vitesse interactive. Un NAS uniquement CPU exécute toujours un petit modèle ; les temps de réponse sont de quelques secondes par phrase au lieu de tokens par seconde.

Puis-je garder le modèle hébergé sur NAS privé sur mon LAN?

Oui. Ollama, LM Studio et LocalAI se lient à l’interface LAN par défaut. Ajoutez une auth de base ou un proxy inverse pour quelque chose de plus qu’un LAN domestique.

Combien d’espace disque les modèles locaux ont-ils besoin?

Un modèle quantifié 8B se situe autour de 5 GB. Un modèle quantifié 70B se situe plus près de 40 GB. Un NAS avec un volume de rechange de 500 GB contient une bibliothèque complète.

Plusieurs personnes peuvent-elles utiliser le modèle en même temps?

Ollama, LocalAI et Text Generation WebUI sérialisent tous par défaut. vLLM gère les requêtes concurrentes nativement. Pour une petite famille, la sérialisation va bien.

Qu’en est-il de la confidentialité?

Chaque application de cette liste exécute le modèle localement. Aucune invite ou réponse n’est envoyée à un tiers à moins que l’application ne soit configurée pour le faire.