LiteLLM

L’article de XDA sur Nvidia Personal AI Router a touché un point sensible : deux PC derrière un point de terminaison unique, les requêtes de modèle routées par poids et santé, sans éditer les fichiers de configuration dans cinq applications. Le point clé est que la version de Nvidia est une variante d’une catégorie que la pile open-source couvre déjà, et avec un support de modèles plus large. Si vous avez une station de travail avec une 4090 et un mini PC exécutant Ollama dans le placard, un proxy qui les unifie est la pièce manquante.

Nous avons testé sept équilibreurs de charge et passerelles pour l’inférence locale de LLM en 2026. Chaque option se place devant Ollama, vLLM, LM Studio, llama.cpp ou une combinaison, expose un point de terminaison compatible OpenAI et gère le routage quand un backend est occupé, hors ligne ou inadapté à la tâche.

Ce qu’il faut rechercher dans un équilibreur de charge IA local

Comparaison rapide

Application Meilleur pour Backends Licence Open source
LiteLLM Proxy universel avec 100+ fournisseurs Tout compatible OpenAI MIT Oui
Olla Purement local, empreinte minuscule Ollama, vLLM, LM Studio, SGLang, llama.cpp Apache 2.0 Oui
Nvidia Personal AI Router Configurations matérielles Nvidia sur Windows Backends optimisés Nvidia Gratuit (enregistrement) Non
vLLM Serveur à haut débit d’un seul modèle Moteur vLLM Apache 2.0 Oui
Ollama Hôte multimodèle le plus simple Natif MIT Oui
LocalAI Clone OpenAI clé en main avec plus de modèles médias GGUF, ONNX, diffusers MIT Oui
Portkey Passerelle d’entreprise avec contrôles de politique 200+ fournisseurs AGPL / niveau payant Source-available

Les 7 meilleures applications pour l’équilibrage de charge de l’inférence locale d’IA

1. LiteLLM — meilleur dans l’ensemble

LiteLLM s’exécute en tant que proxy Python ou Rust devant vos modèles et fournit un point de terminaison /v1 qui parle OpenAI. Pointez-le vers n’importe quelle combinaison d’Ollama, vLLM, Anthropic hébergé et OpenAI, et il équilibrera la charge entre eux, basculera sur les 429, mettra en cache les invites répétées et appliquera des budgets par clé. La réécriture en Rust 2026 pousse le débit au-delà de 1500 requêtes par seconde sur un seul nœud, ce qui est bien plus que ce dont un labo maison aura jamais besoin, mais agréable sur une passerelle d’équipe partagée.

Où il échoue : Le fichier de configuration s’agrandit rapidement une fois que vous ajoutez des arbres de basculement et des niveaux de coûts. Le tableau de bord est fonctionnel mais rien que vous montreriez.

Prix : Gratuit et open source (MIT). Une version payante entreprise ajoute SSO et les journaux d’audit.

Plateformes : Windows, macOS, Linux, Docker.

Télécharger : litellm.ai · GitHub

Résumé : Si vous voulez un routeur qui croît du labo maison aux API hébergées, commencez ici.

2. Olla — meilleure option purement locale

Olla est un proxy LLM conçu spécifiquement pour l’inférence auto-hébergée. Il communique avec Ollama, LM Studio, vLLM, llama.cpp, SGLang et LiteLLM lui-même, découvre les modèles sur chaque backend automatiquement et reste en dessous de 50 Mo de mémoire. Le basculement entre deux boîtes Ollama est un fichier YAML de cinq lignes, et les métriques exposées alimentent Prometheus sans plugin.

Où il échoue : Pas de suivi des coûts intégré ni d’application de budget, car il ne touche pas aux API hébergées. La communauté est plus petite que celle de LiteLLM.

Prix : Gratuit et open source (Apache 2.0).

Plateformes : Windows, macOS, Linux, Docker. Un seul binaire statique.

Télécharger : thushan.github.io/olla · GitHub

Résumé : Choisissez ceci si votre pile entière est sur du matériel que vous possédez et que vous voulez un routeur qui démarre en une seconde.

3. Nvidia Personal AI Router — meilleure option clé en main sur matériel Nvidia

Nvidia Personal AI Router est le sujet de l’article XDA. Il est livré en tant qu’application Windows qui analyse votre LAN, trouve les nœuds d’inférence basés sur Nvidia et les regroupe derrière un point de terminaison local. Le routage du modèle, le streaming et le transfert de quantification sont gérés à l’intérieur du routeur, et les applications cliente du même ensemble (Nvidia ChatRTX et Nvidia AI Workbench) se connectent directement.

Où il échoue : Orienté Nvidia : les cartes Radeon et Intel Arc sont des citoyens de second ordre. Le routeur n’expose pas nativement un point de terminaison compatible OpenAI, donc les clients tiers ont besoin d’un shim.

Prix : Gratuit avec un compte développeur Nvidia.

Plateformes : Windows.

Télécharger : nvidia.com/ai-router

Résumé : Le moyen le plus facile de regrouper deux rigs Nvidia en un seul point de terminaison IA si vous ne quittez jamais l’écosystème Nvidia.

4. vLLM — meilleur pour maximiser un seul GPU puissant

vLLM n’est pas un routeur en soi, mais son serveur compatible OpenAI avec batching continu et PagedAttention pousse le débit sur un seul GPU bien au-delà de ce qu’Ollama peut atteindre. Dans une configuration à deux nœuds, exécuter vLLM derrière LiteLLM ou Olla est le modèle standard pour servir un grand modèle à une équipe, tandis que les backends moins chers gèrent la longue traîne.

Où il échoue : Le chargement du modèle est plus lent qu’Ollama ; pas de secours CPU uniquement. Le support de quantification traîne derrière llama.cpp.

Prix : Gratuit et open source (Apache 2.0).

Plateformes : Linux avec CUDA, ROCm ou Intel XPU. Windows via WSL2. Le support Metal macOS est piloté par la communauté.

Télécharger : vllm.ai · GitHub

Résumé : Utilisez ceci comme l’un des backends vers lequel votre routeur dirige le travail, pas comme le routeur lui-même.

5. Ollama — meilleur pour l’hébergement multimodèle simple

Ollama reste sur la liste car la plupart des configurations maison l’exécutent déjà, et sa file d’attente intégrée gère plusieurs requêtes simultanées raisonnablement bien. Associez-la avec un routeur en avant pour une haute disponibilité, ou exécutez deux boîtes Ollama avec Olla pour un basculement de secours actif.

Où il échoue : Le débit par GPU traîne derrière vLLM de 4-8x sur les charges par lots. Pas de suivi des coûts, pas d’intelligence de routage.

Prix : Gratuit et open source (MIT).

Plateformes : Windows, macOS, Linux, Docker.

Télécharger : ollama.com · GitHub

Résumé : Le backend fiable, pas le routeur. Gardez-le et mettez quelque chose de plus intelligent devant.

6. LocalAI — meilleur si le routeur double aussi en tant qu’hôte d’inférence

LocalAI est un seul binaire qui parle l’API OpenAI et héberge les LLM, les modèles d’intégration, TTS, la génération d’images et la conversion vocale. Il peut appeler d’autres backends Ollama ou vLLM en arrière-plan, ce qui en fait un bon tout-en-un pour un labo maison à nœud unique où vous préféreriez exécuter un processus plutôt que trois.

Où il échoue : Moins flexible que LiteLLM pour les configurations hybrides locales plus hébergées. Le support des modèles médias signifie que le binaire est lourd.

Prix : Gratuit et open source (MIT).

Plateformes : Windows, macOS, Linux, Docker.

Télécharger : localai.io · GitHub

Résumé : Bon choix si vous voulez un routeur et un hôte de modèles médias complet sur la même boîte.

7. Portkey — meilleur si vous avez besoin de contrôles de politique

Portkey est l’option de niveau entreprise. Il fait face aux modèles locaux et hébergés comme le fait LiteLLM mais ajoute des protections, la rédaction de PII et les politiques de routage par équipe prêtes à l’emploi. La version OSS auto-hébergée couvre les bases du routage ; SSO, audit et le tableau de bord géré se trouvent derrière la version payante.

Où il échoue : AGPL effraie certains homelabbers. Le moteur de politique complet n’est utile que si une équipe s’y appuie.

Prix : Auto-hébergé gratuit (AGPL) ; les niveaux gérés payants commencent à des frais mensuels modestes par siège.

Plateformes : Docker sur n’importe quel OS hôte.

Télécharger : portkey.ai · GitHub

Résumé : Excessif pour un labo maison en solo, de la bonne taille pour une passerelle d’équipe réduite.

Comment choisir la bonne

FAQ

Quelle est la différence entre un équilibreur de charge et un moteur d’inférence ?

Un moteur d’inférence (vLLM, Ollama, llama.cpp) exécute le modèle réel. Un équilibreur de charge ou une passerelle (LiteLLM, Olla) s’asseoit devant et décide quel moteur obtient chaque requête. Vous avez besoin des deux : un pour servir, un pour router.

Puis-je équilibrer la charge des modèles locaux avec une API hébergée comme secours ?

Oui. LiteLLM et Portkey sont conçus exactement pour cela. Configurez d’abord le modèle local avec un poids de coût inférieur, puis un fournisseur hébergé comme secours ; le routeur utilise l’API hébergée uniquement lorsque votre GPU est en panne ou surchargé.

Ai-je besoin d’un routeur si je n’ai qu’un seul GPU ?

Pas strictement, mais cela aide toujours. Un routeur vous donne un point de terminaison stable, une logique de nouvelle tentative et l’observabilité, donc si vous remplacez Ollama par vLLM plus tard, vous n’avez pas besoin de toucher à une application cliente.

Le Nvidia Personal AI Router fonctionne-t-il avec les GPU AMD ou Intel ?

Pas officiellement. Il cible le matériel Nvidia et CUDA. Pour les configurations mixtes, LiteLLM ou Olla traiteront tout backend compatible OpenAI de la même manière indépendamment du fabricant.

Lequel a la latence la plus faible ?

Olla ajoute moins de 5 ms sur un réseau local dans les tests, grâce à son noyau Go. LiteLLM est autour de 10-15 ms avec le moteur Rust sur un cache chaud. Pour la plupart des charges de travail de chat et de codage, les deux sont invisibles à côté du temps de décodage du modèle lui-même.