Exécuter un LLM local a du sens tant que vous êtes à la maison. Le modèle se trouve sur une machine à la maison, votre requête est sur un ordinateur portable à 5000 miles de distance, et ouvrir le port 11434 sur le routeur n’est pas la solution. Les outils ci-dessous résolvent ce problème : ils exposent Ollama ou llama.cpp uniquement à vos appareils, chiffrés, sans IP publique.
Nous avons testé sept applications de réseaux maillés, de tunnélisation et de passerelles contre trois configurations locales de LLM (Ollama sur une station de travail, llama.cpp sur un mini PC et Open WebUI dans un conteneur Docker). Voici ce qui fonctionne réellement lorsque vous souhaitez interroger un modèle hébergé à la maison depuis un café ou un WiFi d’hôtel, classé selon l’effort de configuration et la fiabilité.
Ce qu’il faut rechercher dans un outil d’accès à distance LLM
Le choix se résume principalement à cinq choses.
- Sans configuration vs chargé de configuration. Tailscale et Twingate gèrent automatiquement la traversée NAT. WireGuard nécessite un port forwarding.
- Latence. Les connexions peer-to-peer directes battent celles routées par relais. Tailscale préfère direct ; Cloudflare Tunnel utilise toujours un relais.
- Performances du streaming de tokens. Certains tunnels mettent mal en mémoire tampon les réponses et détruisent l’UX de streaming d’Ollama. Testez avec une longue requête.
- Modèle d’authentification. L’intégration SSO est importante si vous partagez le modèle avec une équipe ; l’utilisation personnelle nécessite simplement une liste d’appareils.
- Coût de la bande passante. Les plans gratuits limitent le trafic. Une réponse Llama 3 de 8K tokens est petite ; 100 chats par jour à 8K tokens chacun rentre toujours dans n’importe quel plan gratuit.
Comparaison rapide
| Application | Meilleur pour | Plateformes | Plan gratuit | Prix de départ/mois | Évaluation |
|---|---|---|---|---|---|
| Tailscale | Réseau maillé sans configuration | Multiplateforme | 100 appareils gratuits | Environ 6$/mois Personal Pro | 4.8 |
| ZeroTier | Topologie réseau personnalisée | Multiplateforme | 25 appareils gratuits | Environ 5$/mois Pro | 4.5 |
| Cloudflare Tunnel | URL public sans ouvrir les ports | Multiplateforme | Gratuit illimité | Gratuit | 4.6 |
| Twingate | ZTNA avec politiques d’authentification | Multiplateforme | 5 utilisateurs gratuits | Environ 10$/utilisateur/mois | 4.4 |
| Netbird | Équivalent open source Tailscale | Multiplateforme | 100 pairs gratuits | Auto-hébergement gratuit | 4.4 |
| WireGuard | Réseau maillé brut, sans dépendances | Multiplateforme | Entièrement gratuit | Gratuit | 4.7 |
| Open WebUI | Frontend LLM local avec authentification | Docker | Entièrement gratuit | Gratuit | 4.6 |
Les applications
1. Tailscale — Meilleur réseau maillé sans configuration
Tailscale est la réponse par défaut à « comment accéder à mon LLM domestique de n’importe où. » Installez le client sur l’hôte LLM, installez-le sur votre ordinateur portable, connectez-vous sur les deux, et les deux appareils se communiquent par leur nom d’hôte Tailscale. Pas de port forwarding, pas de DNS dynamique, pas de règles de pare-feu manuelles.
La connexion peer-to-peer directe est la raison pour laquelle elle fonctionne bien pour la diffusion en continu des réponses d’Ollama. La latence reste inférieure à 30 ms sur la plupart des connexions domestiques. Lorsque les pairs ne peuvent pas se connecter directement (derrière NAT de classe opérateur), Tailscale revient à ses relais DERP, qui ajoutent de la latence mais ne rompent jamais la connexion.
Où elle fait défaut : Le plan gratuit est généreux mais lié à un seul propriétaire. Servir un modèle à des collègues sur des comptes séparés nécessite le plan Pro ou un nœud partagé.
Tarification :
- Gratuit : 100 appareils, 3 utilisateurs
- Payant : Environ 6$/mois Personal Pro, 6$/utilisateur/mois Business
Plateformes : Windows, macOS, Linux, iOS, Android
Télécharger : Tailscale
Résumé : Installez ceci en premier. Cela résout 90% de l’accès à distance LLM en 5 minutes de configuration.
2. ZeroTier — Meilleur pour la topologie réseau personnalisée
ZeroTier précède Tailscale et vous donne plus de contrôle sur la forme du réseau. Plusieurs réseaux par appareil, règles de flux par réseau et personnalisation du schéma IP fonctionnent tous via la console Web. Le compromis est plus de configuration pour un cas d’utilisation LLM domestique.
Les performances peer-to-peer directives sont similaires à Tailscale. L’attrait principal est si vous exécutez déjà ZeroTier pour d’autres services et souhaitez le LLM sur le même réseau.
Où elle fait défaut : L’interface est plus dense que celle de Tailscale. L’intégration de nouveaux appareils nécessite une étape d’approbation supplémentaire.
Tarification :
- Gratuit : 25 appareils par réseau
- Payant : Environ 5$/mois pour 100 appareils et plus
Plateformes : Windows, macOS, Linux, iOS, Android, FreeBSD
Télécharger : ZeroTier
Résumé : Le meilleur choix si vous utilisez déjà ZeroTier ou souhaitez des ACL par flux sur votre trafic LLM.
3. Cloudflare Tunnel — Meilleur pour une URL public sans ouvrir les ports
Si vous voulez une URL réelle (comme ollama.yourdomain.com) que n’importe qui avec l’URL et les identifiants peut frapper, Cloudflare Tunnel le fait sans ouvrir un port sur votre routeur. Le tunnel se connecte vers l’extérieur vers le bord de Cloudflare, et Cloudflare sert le trafic aux visiteurs.
Les politiques d’accès Zero Trust vous permettent de contrôler l’URL par email, plage d’IP ou équipe GitHub. C’est la réponse lorsque vous souhaitez partager un modèle avec un petit groupe sans donner à chacun un client réseau maillé.
Où elle fait défaut : Tout le trafic transite par le bord de Cloudflare, donc la latence est pire que le peer-to-peer direct. Les réponses de streaming fonctionnent mais voient 100-200 ms de surcharge.
Tarification :
- Gratuit : Bande passante illimitée pour usage personnel
- Payant : Zero Trust ajoute des sièges payants au-delà de 50 utilisateurs
Plateformes : Cloudflared s’exécute sur Windows, macOS, Linux ; navigateurs sur n’importe quelle plateforme
Télécharger : Cloudflared
Résumé : Choisissez ceci plutôt que Tailscale si vous voulez une URL réelle à marquer, pas un nom d’hôte privé. Plus lent mais plus facile à partager.
4. Twingate — Meilleur pour les équipes avec politiques SSO
Twingate est un produit d’accès réseau Zero Trust qui restreint les ressources spécifiques (paires hôte+port) derrière l’authentification SSO. Configurez l’hôte LLM dans la console d’administration, attribuez les politiques (ce groupe Google peut y accéder), et les utilisateurs se connectent via le client Twingate.
Le tunneling divisé est plus robuste que celui de Tailscale ; seul le trafic pour les ressources contrôlées passe par Twingate. Tout le reste utilise Internet directement.
Où elle fait défaut : Le plan gratuit est limité à 5 utilisateurs. Excessif pour une configuration LLM domestique pour une seule personne.
Tarification :
- Gratuit : 5 utilisateurs, 10 appareils
- Payant : Environ 10$/utilisateur/mois Business
Plateformes : Windows, macOS, Linux, iOS, Android
Télécharger : Twingate
Résumé : Le meilleur choix lorsqu’une petite équipe partage un LLM local et que vous souhaitez un contrôle d’accès soutenu par SSO.
5. Netbird — Meilleur équivalent open source Tailscale
Netbird est le remplacement plug-and-play open source le plus proche de Tailscale. Même modèle maillé, même traversée NAT automatique, même expérience client, mais le serveur de coordination est auto-hébergeable. Exécutez-le sur votre propre VPS et aucun tiers ne connaît la forme de votre réseau.
Le plan gratuit hébergé est de 100 pairs, donc une configuration personnelle n’atteindra jamais la limite.
Où elle fait défaut : Projet plus jeune que Tailscale, donc les clients mobiles sont en retard dans le vernis. L’auto-hébergement ajoute un fardeau opérationnel.
Tarification :
- Gratuit : 100 pairs sur le service hébergé de Netbird
- Payant : Auto-hébergement gratuit ; Tier Business pour hébergé commence à environ 8$/utilisateur/mois
Plateformes : Windows, macOS, Linux, iOS, Android
Télécharger : Netbird
Résumé : Choisissez ceci si vous aimez Tailscale mais voulez que le serveur de coordination soit sur votre propre matériel.
6. WireGuard — Meilleur pour les performances brutes et sans dépendances
WireGuard est le protocole sous-jacent derrière Tailscale, Netbird et la plupart des VPN maillés modernes. Le faire fonctionner directement (sans couche de coordination) signifie une configuration manuelle des pairs et soit une IP statique, soit un DNS dynamique sur l’hôte LLM.
Pour un utilisateur technique avec une IP statique à la maison, c’est l’option de surcharge la plus basse. Pas de compte, pas de serveur de coordination, pas de confiance tierce.
Où elle fait défaut : Chaque paire d’appareils nécessite un échange manuel de clés. La traversée NAT est à vous. Ajouter un nouvel appareil est une édition de fichier de configuration.
Tarification :
- Gratuit : Open source
- Payant : Aucun
Plateformes : Windows, macOS, Linux, iOS, Android
Télécharger : WireGuard
Résumé : Meilleur pour le contrôle, pire pour la commodité. Utilisez ceci si vous exécutez déjà WireGuard pour d’autres services.
7. Open WebUI — Meilleur frontend LLM local avec authentification intégrée
Plutôt que de tunnéliser le port brut d’Ollama, exécutez Open WebUI comme frontend sur la même machine et exposez uniquement la WebUI. Il est livré avec des comptes utilisateurs, l’historique des chats par utilisateur, l’ingestion de documents RAG et une interface propre de style ChatGPT.
Combinez avec Tailscale pour un accès privé, ou avec Cloudflare Tunnel pour une URL publique avec la couche d’authentification propre de WebUI comme portail.
Où elle fait défaut : Ajoute un conteneur Docker et des mises à jour continues. S’exécute légèrement plus lentement qu’Ollama brut pour la diffusion en continu en raison du saut supplémentaire.
Tarification :
- Gratuit : Open source
- Payant : Aucun
Plateformes : Docker (s’exécute sur n’importe quel hôte Linux, macOS, Windows)
Télécharger : Open WebUI
Résumé : Appairez avec Tailscale pour la meilleure expérience combinée. WebUI gère l’authentification et l’UX ; Tailscale gère le réseau.
Comment choisir le bon
Si vous voulez la configuration la plus rapide : Tailscale, plus Ollama sur l’hôte LLM. Dix minutes du début à la fin.
Si vous voulez une URL réelle à partager : Cloudflare Tunnel, limité par les politiques Zero Trust.
Si vous êtes une équipe : Twingate pour l’accès contrôlé par SSO, ou Tailscale Business.
Si vous auto-hébergez tout : Netbird sur votre propre serveur de coordination, ou WireGuard brut si vous avez une IP statique.
Si votre pile LLM local est Ollama ou llama.cpp : installez également Open WebUI. La différence UX par rapport à curl brut ou aux clients API est significative, et l’authentification intégrée signifie que vous pouvez ajouter un tunnel par-dessus sans tuyauterie supplémentaire.
FAQ
Est-il sûr d’exposer Ollama via Tailscale ? Oui. Le trafic Tailscale est chiffré de bout en bout avec WireGuard, et seuls vos appareils Tailnet peuvent atteindre le port Ollama. Ollama elle-même n’a pas d’authentification, donc le réseau privé fait le travail de sécurité.
Le streaming fonctionne-t-il via Cloudflare Tunnel ? Oui pour la diffusion en continu HTTP (événements envoyés par le serveur). La réponse de streaming par défaut d’Ollama fonctionne. WebSockets fonctionne également mais avec une latence légèrement plus élevée que le chemin SSE.
Puis-je utiliser ces outils sans IP statique ou port forwarding ? Oui pour Tailscale, ZeroTier, Cloudflare Tunnel, Twingate et Netbird. Tous gèrent la traversée NAT ou les tunnels sortants uniquement. WireGuard seul nécessite une IP statique ou un DNS dynamique.
Combien de bande passante un chat LLM local utilise-t-il ? Une réponse de 8K tokens sur Ollama fait moins de 100 Ko compressée. Même 1000 chats par jour font moins de 100 Mo, bien à l’intérieur de tout plan gratuit.
Que se passe-t-il si mon FAI utilise CGNAT ? Tailscale et Netbird reviennent aux serveurs relais lorsque la connexion directe est impossible. Cloudflare Tunnel fonctionne quoi qu’il en soit car il est sortant uniquement. WireGuard seul ne fonctionnera pas sans un point de terminaison public.
Puis-je utiliser ceux-ci pour exposer un LLM local à des amis ? Twingate et Cloudflare Tunnel avec Zero Trust supportent les politiques d’accès par utilisateur. Tailscale peut partager des nœuds avec des utilisateurs spécifiques via le partage de nœuds. Open WebUI ajoute l’isolation des chats par utilisateur au-dessus de n’importe lequel de ceux-ci.