XDA a exécuté le même modèle 8B sur un ordinateur portable RTX 5070 et sur une machine avec graphiques intégrés et a rapporté que l’écart jetons par seconde était plus petit que ce que la plupart des gens imaginent. C’est l’histoire des LLM locaux en 2026 : la quantification, les backends Vulkan et le Metal d’Apple ont apporté de nombreuses charges de travail dans une plage où un iGPU ou un petit dGPU suffit. Vous n’avez pas besoin d’un rig de 2 000 $ pour exécuter des modèles utiles localement.
Ce guide couvre huit applications pour exécuter des LLM locaux sur graphiques intégrés, testées sur un Intel Core Ultra 5 avec Arc iGPU, un AMD Ryzen 7 avec Radeon 780M et un Apple M2. Les huit exécutent des modèles dans la gamme 7B à 14B à des vitesses utilisables (10 jetons par seconde ou mieux) avec la bonne quantification. Nous avons priorisé la facilité de configuration, la compatibilité des modèles et les performances honnêtes sur le matériel de classe iGPU.
Ce qu’il faut rechercher dans un exécuteur LLM local pour iGPU
- Plusieurs backends. Vulkan est le grand égalisateur sur Windows et Linux ; il permet aux iGPU AMD Radeon et Intel Arc d’utiliser l’accélération matérielle sans kits d’outils verrouillés par le fournisseur. Metal est l’équivalent sur Apple silicon.
- Support GGUF. GGUF est le format de quantification de facto actuel. Q4_K_M ou Q5_K_M donne le meilleur rapport vitesse-qualité pour les budgets VRAM de classe iGPU.
- Un catalogue de modèles que vous n’avez pas à chasser. Les meilleures applications incluent des téléchargements de modèles en un clic depuis Hugging Face, donc vous ne poursuivez pas les torrents.
- Des valeurs par défaut sensées. Les utilisateurs de iGPU bénéficient des applications qui préconfigent la longueur du contexte, le nombre de threads et le pourcentage de déchargement du GPU plutôt que de vous les faire régler manuellement.
- UI Chat plus API. Les meilleurs exécuteurs fonctionnent en double comme serveurs API compatibles OpenAI pour que vous puissiez pointer d’autres outils vers eux.
- Petite empreinte mémoire. iGPU partage la RAM avec le système d’exploitation. Préférez les applications qui vous permettent de limiter la longueur du contexte et de décharger les modèles au repos.
Comparaison rapide
| Application | Meilleure pour | Plan gratuit | Prix de démarrage | Style UI |
|---|---|---|---|---|
| Ollama | CLI + API pour modèles locaux | Oui | Gratuit (open source) | Terminal ou clients tiers |
| LM Studio | UI de bureau poli | Oui | Gratuit | Bureau natif |
| GPT4All | Bureau convivial pour débutants | Oui | Gratuit | Bureau natif |
| Jan | Clone ChatGPT entièrement open source | Oui | Gratuit | Bureau natif (Electron) |
| Msty | Tout en un avec RAG | Oui | Base gratuite | Bureau natif |
| KoboldCpp | Jeu de rôle et écriture créative | Oui | Gratuit (open source) | Web UI |
| Text Generation WebUI | Expérimentation avancée | Oui | Gratuit (open source) | Web UI |
| AnythingLLM | RAG local sur documents | Oui | Gratuit (open source) | Bureau natif |
Les applications
1. Ollama, meilleur exécuteur CLI et API
Ollama est ce qui se rapproche le plus d’une norme pour les LLM locaux. Installez-le, exécutez ollama run llama3.2:3b, et vous avez un modèle fonctionnant en moins d’une minute. Sous le capot, il utilise llama.cpp avec une bibliothèque de modèles conservée, une API compatible OpenAI sur localhost:11434 et la gestion de la mémoire par modèle.
Où il faiblit : Pas d’UI de chat intégrée ; vous utilisez ollama run dans un terminal ou vous l’associez à un client (Open WebUI, Msty ou Enchanted sur Mac). La bibliothèque de modèles sur ollama.com est conservée mais limitée par rapport à l’accès direct à Hugging Face.
Tarification :
- Gratuit, open source (MIT).
Plateformes : Windows, macOS (Apple silicon et Intel), Linux.
Télécharger : ollama.com/download ou via Homebrew / apt.
Conclusion : Le meilleur backend, c’est tout. Installez-le même si vous prévoyez d’utiliser une interface différente par-dessus.
2. LM Studio, meilleur UI de bureau poli
LM Studio encapsule llama.cpp dans une application de bureau native avec un navigateur de modèles Hugging Face intégré, des téléchargements en un clic, des repères de performance par modèle et un serveur API compatible OpenAI. Les paramètres de déchargement du GPU sont exposés avec des valeurs par défaut sensées pour Intel Arc, AMD et Apple silicon.
Où il faiblit : Fermeture de source (bien que gratuit). Certains utilisateurs signalent que l’interface graphique consomme plus de RAM que le modèle lui-même sur les iGPU d’entrée de gamme.
Tarification :
- Gratuit pour un usage personnel, l’usage commercial nécessite une licence.
Plateformes : Windows, macOS, Linux (bêta).
Télécharger : lmstudio.ai
Conclusion : Le meilleur point de départ pour les utilisateurs de iGPU qui préfèrent une interface graphique. Fourni avec les bons paramètres par défaut pour le matériel grand public.
3. GPT4All, meilleur bureau convivial pour débutants
GPT4All de Nomic est le plus accessible du lot. Installez, choisissez un modèle dans la barre latérale, et il télécharge et s’exécute. Le volet LocalDocs ajoute un RAG simple sur un dossier de fichiers sans configuration.
Où il faiblit : Catalogue de modèles plus petit que LM Studio. Plus lent sous Windows qu’Ollama ou LM Studio dans nos tests.
Tarification :
- Gratuit.
Plateformes : Windows, macOS, Linux.
Télécharger : nomic.ai/gpt4all
Conclusion : Le choix pour votre ami ou votre famille moins technique. Les met à exécuter un modèle local sans toucher à un terminal.
4. Jan, meilleur clone ChatGPT entièrement open source
Jan est une application de bureau entièrement open source qui imite l’interface de ChatGPT. Il exécute des modèles locaux via llama.cpp fourni, se connecte à des API distantes (OpenAI, Anthropic, Groq, Mistral) en option et stocke chaque conversation localement.
Où il faiblit : Basé sur Electron, donc l’empreinte RAM est plus lourde que les applications natives. Les conversations multi-tours perdent occasionnellement le contexte sur iGPU en raison de la troncature agressive du contexte.
Tarification :
- Gratuit, open source (AGPL).
Plateformes : Windows, macOS, Linux.
Télécharger : jan.ai
Conclusion : Le plus similaire à ChatGPT open. Mieux si vous voulez une seule application pour local plus optionnel distant.
5. Msty, meilleur tout en un avec RAG
Msty combine les modèles locaux, les API distantes, RAG sur documents et les conversations en vue fractionnée dans une application. Sa fonction “Knowledge Stacks” indexe des dossiers de PDF, de documents Word et de fichiers texte pour que vous puissiez discuter avec eux sans configurer une base de données vectorielle.
Où il faiblit : Code fermé. Le plan gratuit limite certaines fonctionnalités RAG avancées.
Tarification :
- Base gratuite.
- Pro ajoute la synchronisation dans le cloud, RAG avancé et le support prioritaire (tarification sur leur site).
Plateformes : Windows, macOS, Linux.
Télécharger : msty.app
Conclusion : Le choix si vous voulez discuter de documents sans configurer un magasin vectoriel séparé.
6. KoboldCpp, meilleur pour le jeu de rôle et l’écriture créative
KoboldCpp a commencé comme un fork de llama.cpp destiné à l’écriture de forme longue et au jeu de rôle. Il dispose d’une interface web avec des informations mondiales, une mémoire de personnage et des livres de lore que les autres exécuteurs ne présentent pas. Le backend supporte Vulkan pour iGPU.
Où il faiblit : L’interface est dense avec des curseurs qui ne signifient quelque chose que pour les utilisateurs avancés. Pas vraiment conçu pour les flux de travail d’assistant de chat.
Tarification :
- Gratuit, open source (AGPL).
Plateformes : Windows, macOS, Linux.
Télécharger : KoboldCpp GitHub releases.
Conclusion : Choix de niche pour les écrivains et les joueurs de rôle qui veulent des personnages persistants.
7. Text Generation WebUI, meilleure expérimentation avancée
Text Generation WebUI (oobabooga) est le terrain de jeu des expérimentateurs. Il supporte llama.cpp, ExLlama, Transformers et d’autres backends, expose chaque paramètre de génération et s’intègre avec LoRA et le fine-tuning.
Où il faiblit : La configuration n’est pas pour les débutants ; attendez-vous à une installation de 30 minutes avec Python venv. L’interface web est fonctionnelle mais pas conçue.
Tarification :
- Gratuit, open source (AGPL).
Plateformes : Windows, macOS, Linux via Python.
Télécharger : oobabooga/text-generation-webui GitHub.
Conclusion : Le bon choix quand vous savez ce que vous voulez régler et ne pouvez pas l’obtenir dans une meilleure application.
8. AnythingLLM, meilleur RAG local sur documents
AnythingLLM est une application RAG construite à cet effet qui associe un LLM local (ou distant) à un magasin de documents. Pointez-le vers un dossier ou déposez des fichiers, et il les indexe dans une base de données vectorielle locale. Les espaces de travail multi-utilisateurs séparent les contextes pour différents projets.
Où il faiblit : Axé sur RAG ; le chat pur est possible mais pas le point. La configuration implique de choisir un modèle d’intégration séparément du modèle de chat, ce qui embrouille les débutants.
Tarification :
- Gratuit, open source (MIT).
Plateformes : Windows, macOS, Linux, plus déploiement Docker pour l’auto-hébergement.
Télécharger : anythingllm.com ou Mintplex-Labs/anything-llm GitHub.
Conclusion : Le choix si la raison pour laquelle vous voulez l’IA locale est d’interroger votre propre collection de documents en privé.
Comment choisir le bon
- Si vous voulez le modèle local fonctionnant le plus rapidement sans tracas : Ollama.
- Si vous voulez une interface graphique native et des valeurs par défaut sensées : LM Studio.
- Si vous êtes complètement nouveau aux LLM locaux : GPT4All.
- Si vous voulez ChatGPT entièrement open source : Jan.
- Si vous voulez discuter avec vos PDF : AnythingLLM ou Msty.
- Si vous écrivez de la fiction ou du jeu de rôle : KoboldCpp.
- Si vous voulez régler chaque paramètre : Text Generation WebUI.
La meilleure configuration appairée pour la plupart des utilisateurs de iGPU : Ollama comme backend + LM Studio ou Open WebUI comme client. Cela vous donne le backend le plus rapide avec l’interface la plus conviviale.
FAQ
Quelle est la meilleure application LLM locale pour Intel Arc iGPU ?
LM Studio et Ollama utilisent tous deux Vulkan et fonctionnent bien sur Intel Arc iGPU (Xe, Xe2, Xe-LPG). Le choix du modèle importe plus que le choix de l’application ; les quantifications Q4_K_M des modèles 7B à 8B sont le point idéal.
Puis-je exécuter des LLM locaux sur un APU Ryzen sans GPU discret ?
Oui. Les iGPU Radeon 780M / 890M des séries Ryzen 7000 et 8000 exécutent des modèles 7B à 10 à 20 jetons par seconde en quantification Q4 via Vulkan. Augmentez l’allocation de RAM système aux graphiques dans le BIOS si vous voulez charger des contextes plus grands.
Quel est le meilleur LLM local pour un MacBook avec M2 ou M3 ?
Apple silicon exécute Llama 3.1 8B, Qwen 3 8B et Mistral 7B à 20 à 40 jetons par seconde sur M2. LM Studio et Ollama utilisent tous deux Metal automatiquement. Sur 16 Go de mémoire unifiée, restez avec Q4_K_M ou Q5_K_M.
Dois-je connaître Python pour exécuter des modèles locaux ?
Non. Ollama, LM Studio, GPT4All, Jan et Msty sont tous des installations en un clic sans Python. Text Generation WebUI est l’exception.
Quelle application LLM locale est entièrement open source ?
Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI et AnythingLLM sont tous open source. LM Studio et Msty sont gratuits mais code fermé.
Combien de RAM me faut-il pour les LLM locaux ?
Pour les modèles 7B à 8B en quantification Q4, 16 Go de RAM système total sont viables et 32 Go sont confortables. iGPU partage la RAM du système, donc budgétisez en conséquence. Pour les modèles 13B à 14B, prévoyez un minimum de 32 Go.