Gestion des pilotes NVIDIA Proxmox pour les LLM locaux sur le bureau

Proxmox 9.2, lancé en août 2026, est arrivé avec une mise à jour du noyau qui a cassé les modules noyau ouverts de NVIDIA pour de nombreux utilisateurs de laboratoires domestiques exécutant des LLM locaux, et le correctif s’est avéré être un pilote corrigé que NVIDIA a lancé environ une semaine plus tard. C’est le modèle que chaque propriétaire de Proxmox exécutant un GPU pour l’inférence en viendra à connaître : une mise à jour du noyau arrive, le pilote rejette les nouveaux en-têtes, nvidia-smi retourne “No devices were found”, et Ollama ou vLLM ne démarre pas jusqu’à ce que vous reconstruisiez.

Les meilleures applications pour gérer les pilotes NVIDIA sur Proxmox pour les charges de travail LLM locales réduisent ce modèle d’une crise à une routine. Voici sept outils de bureau qui méritent d’être installés avant la prochaine mise à jour du noyau.

Quoi rechercher dans une pile Proxmox NVIDIA

Commencez par le chemin d’installation du pilote. L’installateur .run fourni par le fournisseur fonctionne et vaut la peine d’être compris, mais pour un laboratoire domestique, vous voulez la reproductibilité d’un paquet. Cela signifie un .deb signé du référentiel CUDA de NVIDIA ou un chemin scriptable qui épingle une version du pilote connue comme bonne.

Faites attention à DKMS. Dynamic Kernel Module Support reconstruit le module NVIDIA lorsque le noyau est mis à jour. Si vous ignorez DKMS, vous reconstruisez à la main à chaque mise à jour du noyau, et c’est là que vivent les défaillances. Confirmez que le module DKMS a vraiment été reconstruit après la mise à jour plutôt que d’échouer silencieusement.

Surveillez le côté du passage GPU. Si le GPU est transmis à une VM plutôt que de s’exécuter sur l’hôte, le module vit à l’intérieur de la VM et Proxmox a besoin de la liaison vfio-pci pour empêcher l’hôte de saisir la carte. Un passage brisé est souvent confondu avec un pilote brisé.

Enfin, planifiez la surveillance et la restauration. nvidia-smi dans une boucle vous dit que la carte est vivante ; Netdata montre l’utilisation au fil du temps ; une capture instantanée de l’hôte prise avant une mise à jour signifie que la restauration est à un clic de restauration de Proxmox.

Comparaison rapide

Application Rôle Plan gratuit Niveau payant Fonctionnalité remarquable
Proxmox VE L’hyperviseur dans lequel NVIDIA doit vivre Gratuit, open source Abonnement payant pour le référentiel d’entreprise Capture instantanée avant chaque mise à jour du pilote risquée
NVIDIA driver installer Envoie les modules CUDA et du noyau Gratuit Gratuit .deb signé et installateur réseau qui survivent aux mises à jour du noyau
Aprox Proxmox client Accédez à la console Proxmox depuis un téléphone ou un ordinateur de bureau Gratuit Gratuit Redémarrez une VM sans ouvrir le navigateur
Ollama Exécuteur LLM local qui consomme le GPU Gratuit, open source Gratuit Installation d’une ligne, extraction de modèle d’une ligne
Open WebUI Interface de chat au-dessus d’Ollama ou vLLM Gratuit, open source Gratuit Chat multimodèle, RAG, sans dépendances cloud
vLLM Serveur d’inférence LLM haut débit Gratuit, open source Gratuit L’alternative à plus haut débit à Ollama pour les configurations occupées
NVIDIA System Management Interface La ligne de commande nvidia-smi Gratuit, fourni avec le pilote Gratuit L’outil que vous exécutez en premier quand quelque chose casse
Netdata Métriques GPU et système en direct Niveau gratuit Plans cloud payants Utilisation du GPU, température et VRAM au fil du temps

1. Proxmox VE

Proxmox VE est l’hyperviseur à la base de la pile. Pour les charges de travail NVIDIA, le paramètre qui compte le plus est la discipline des captures instantanées : capturez l’hôte et la VM porteuse de GPU avant chaque modification du pilote ou du noyau risquée, afin que la restauration soit une opération en deux clics. Le programme de sauvegarde de l’interface Web Proxmox peut automatiser la capture instantanée du conteneur LXC ou de la VM ; l’hôte lui-même nécessite une approche séparée (une installation sans état, une capture instantanée ZFS du pool racine, ou une note manuelle des indicateurs d’installation).

Où il échoue : Proxmox lui-même n’offre pas d’assistant de passage GPU de première partie. Vous le configurez via la CLI et /etc/pve/qemu-server/<vmid>.conf.

Tarification : Gratuit avec le référentiel communautaire. L’abonnement payant pour le référentiel d’entreprise commence par une modeste redevance annuelle par socket.

Plateformes : Métal nu sur la boîte de calcul.

Télécharger : Proxmox VE

Conclusion : la base. Capturez avant chaque mise à jour du pilote.

2. NVIDIA driver installer

L’installateur de pilote NVIDIA est livré soit en tant que paquet de référentiel CUDA signé, soit en tant qu’installateur .run. Pour les laboratoires domestiques Proxmox, le référentiel CUDA est le chemin le plus fiable : ajoutez le référentiel, installez nvidia-driver-open (les modules noyau ouverts) avec DKMS, redémarrez, vérifiez nvidia-smi. Quand une mise à jour du noyau arrive, DKMS reconstruit le module ; quand ce n’est pas le cas, vous reconstruisez à la main une fois et consignez le correctif.

Où il échoue : les modules noyau ouverts sont toujours la voie la plus récente. Certaines anciennes cartes ont besoin des modules propriétaires, et la matrice des versions mérite d’être lue avant la mise à niveau.

Tarification : Gratuit.

Plateformes : Linux (Debian, Ubuntu et dérivés, que Proxmox utilise).

Télécharger : NVIDIA CUDA repository

Conclusion : l’installation du référentiel avec DKMS est la configuration qui survit le plus souvent aux mises à jour du noyau.

3. Aprox Proxmox client

Aprox est un client téléphone pour Proxmox. Quand une mise à jour de pilote tourne mal au milieu de la journée de travail, Aprox vous permet de redémarrer la VM affectée, de revenir à une capture instantanée, ou de vérifier l’historique des tâches sans ouvrir un navigateur. Il lit la même API Proxmox que l’interface Web utilise.

Où il échoue : c’est un client, pas un remplacement. La configuration approfondie se fait toujours via l’interface Web.

Tarification : Gratuit.

Plateformes : Android ; utilisable à partir de Windows et ChromeOS via les runtimes Android.

Télécharger : Aptoide · Google Play

Conclusion : le client de récupération rapide pour un laboratoire domestique que vous ne voulez pas vous connecter à un bureau complet.

4. Ollama

Ollama est le moyen le plus simple d’exécuter un LLM local sur un GPU Proxmox. Installez dans une VM ou un conteneur LXC avec le GPU passé en revue, tirez un modèle avec une commande d’une ligne, et Ollama expose une API locale sur la forme standard de style OpenAI. Les laboratoires domestiques qui ont commencé avec Ollama et n’ont jamais quitté regrettent rarement.

Où il échoue : le débit est inférieur à vLLM en concurrence. Pour une configuration de chat domestique cela n’a pas d’importance ; pour une petite équipe, cela pourrait.

Tarification : Gratuit, open source.

Plateformes : Linux, macOS, Windows.

Télécharger : Ollama

Conclusion : l’exécuteur par défaut pour un GPU de laboratoire domestique qui ne sert pas encore vLLM.

5. Open WebUI

Open WebUI est l’interface de chat qui s’asseoit au-dessus d’Ollama ou vLLM. Elle gère le chat multimodèle, RAG contre les documents locaux, l’historique des conversations partagées et plusieurs comptes d’utilisateurs. Exécutez dans un conteneur sur la même VM qu’Ollama et il apparaît à une URL que vous pouvez mettre en signet.

Où il échoue : c’est une autre partie mobile. Si vous ne chattez que depuis un terminal, curl contre l’API Ollama fonctionne bien.

Tarification : Gratuit, open source.

Plateformes : Docker (n’importe quel hôte).

Télécharger : Open WebUI

Conclusion : l’interface conviviale pour une configuration LLM domestique.

6. vLLM

vLLM est le serveur d’inférence à plus haut débit pour quand un ménage ou une petite équipe génère suffisamment de tokens par seconde pour que Ollama ralentisse. Il prend en charge l’attention paginée, les demandes par lots et les modèles d’accueil avec une bien meilleure concurrence. La configuration est plus complexe et sensible à la version de CUDA.

Où il échoue : ce n’est pas l’expérience “installer et oublier” qu’Ollama est. Attendez-vous à lire les notes de version et à faire correspondre les versions de CUDA et PyTorch.

Tarification : Gratuit, open source.

Plateformes : Linux avec CUDA.

Télécharger : vLLM

Conclusion : le choix quand la concurrence compte plus que la simplicité de la configuration.

7. NVIDIA System Management Interface

nvidia-smi est la commande que chaque utilisateur de Proxmox-plus-NVIDIA exécute en premier quand quelque chose casse. Elle affiche la version du pilote, le runtime CUDA, l’utilisation du GPU, l’utilisation de la VRAM, les processus actifs, les températures et la puissance. Quand une mise à jour du noyau arrive, nvidia-smi est la première lecture honnête de si le pilote a survécu.

Où elle échoue : c’est une CLI. Il y a une boucle graphique nvidia-smi -l 1 que vous pouvez laisser dans un volet tmux, mais ce n’est pas un tableau de bord.

Tarification : Gratuit, fourni avec le pilote.

Plateformes : Linux, Windows (via le pilote NVIDIA).

Télécharger : Fourni avec l’installation du pilote NVIDIA ci-dessus.

Conclusion : le premier outil que vous devez exécuter après chaque modification du noyau ou du pilote.

8. Netdata

Netdata récupère automatiquement le collecteur NVIDIA lors de l’installation du pilote. Elle restitue l’utilisation du GPU, la VRAM, la puissance et la température à la granularité du niveau de la seconde dans le navigateur. Historiquement, c’est ainsi que vous détectez une limitation thermique qu’un passage de référence ne signale pas.

Où elle échoue : la rétention à long terme au niveau gratuit est limitée. Stockez les métriques historiques dans Prometheus si un an d’historique GPU compte.

Tarification : Niveau gratuit pour un petit nombre de nœuds. Les plans cloud payants ajoutent la rétention.

Plateformes : Linux (agent), n’importe quel navigateur (tableau de bord).

Télécharger : Netdata

Conclusion : le moyen le plus rapide de détecter un dysfonctionnement du GPU au fil du temps.

Comment choisir

Chaque GPU de laboratoire domestique devrait commencer par Proxmox VE (capture instantanée avant les modifications du pilote), le référentiel CUDA NVIDIA avec DKMS et nvidia-smi comme outil de vérification de première instance. Ajoutez Ollama plus Open WebUI pour une configuration LLM conviviale, ou vLLM si le débit compte. Installez Aprox pour le contrôle côté téléphone et Netdata pour la visibilité continue du GPU. Quand une mise à jour du noyau arrive, capturez d’abord, mettez à jour en deuxième, exécutez nvidia-smi en troisième, et vérifiez le volet GPU de Netdata en quatrième. Si l’un d’eux échoue, le client Aprox est plus rapide que d’ouvrir un navigateur pour restaurer.

FAQ

Pourquoi Proxmox 9.2 a-t-il cassé mes LLM locaux ?

La mise à jour du noyau était en avance sur le support du pilote NVIDIA pour cela. NVIDIA a lancé un pilote corrigé environ une semaine plus tard ; l’installation de ce pilote, puis l’exécution de dkms status et le redémarrage ont restauré nvidia-smi et Ollama.

Dois-je utiliser les modules NVIDIA ouverts ou propriétaires sur Proxmox ?

Pour les cartes Ampere et plus récentes récemment, les modules noyau ouverts sont la voie recommandée en 2026 et ce que NVIDIA soutient pour l’avenir. Les anciennes cartes Turing et Pascal s’appuient toujours sur les modules propriétaires.

Ai-je besoin du passage GPU pour Ollama sur Proxmox ?

Si le GPU est sur la boîte de calcul et que vous exécutez Ollama sur l’hôte, non. Si vous exécutez Ollama à l’intérieur d’une VM, oui. Les conteneurs LXC peuvent partager le GPU de l’hôte sans passage avec les bonnes règles cgroup et udev.

Quel est le meilleur exécuteur LLM local sur Proxmox ?

Ollama pour la facilité de configuration, vLLM pour la concurrence. Les deux consomment le pilote NVIDIA installé sur l’invité.

Comment surveille-je la température du GPU au fil du temps sur Proxmox ?

Installez Netdata sur l’invité qui possède le GPU. Elle récupère automatiquement les métriques NVIDIA. Pour la rétention à long terme, envoyez les métriques à Prometheus et affichez-les dans Grafana.