Ollama

XDA a exécuté le même modèle 8B sur un ordinateur portable RTX 5070 et sur une machine avec graphiques intégrés et a rapporté que l’écart jetons par seconde était plus petit que ce que la plupart des gens imaginent. C’est l’histoire des LLM locaux en 2026 : la quantification, les backends Vulkan et le Metal d’Apple ont apporté de nombreuses charges de travail dans une plage où un iGPU ou un petit dGPU suffit. Vous n’avez pas besoin d’un rig de 2 000 $ pour exécuter des modèles utiles localement.

Ce guide couvre huit applications pour exécuter des LLM locaux sur graphiques intégrés, testées sur un Intel Core Ultra 5 avec Arc iGPU, un AMD Ryzen 7 avec Radeon 780M et un Apple M2. Les huit exécutent des modèles dans la gamme 7B à 14B à des vitesses utilisables (10 jetons par seconde ou mieux) avec la bonne quantification. Nous avons priorisé la facilité de configuration, la compatibilité des modèles et les performances honnêtes sur le matériel de classe iGPU.

Ce qu’il faut rechercher dans un exécuteur LLM local pour iGPU

Comparaison rapide

Application Meilleure pour Plan gratuit Prix de démarrage Style UI
Ollama CLI + API pour modèles locaux Oui Gratuit (open source) Terminal ou clients tiers
LM Studio UI de bureau poli Oui Gratuit Bureau natif
GPT4All Bureau convivial pour débutants Oui Gratuit Bureau natif
Jan Clone ChatGPT entièrement open source Oui Gratuit Bureau natif (Electron)
Msty Tout en un avec RAG Oui Base gratuite Bureau natif
KoboldCpp Jeu de rôle et écriture créative Oui Gratuit (open source) Web UI
Text Generation WebUI Expérimentation avancée Oui Gratuit (open source) Web UI
AnythingLLM RAG local sur documents Oui Gratuit (open source) Bureau natif

Les applications

1. Ollama, meilleur exécuteur CLI et API

Ollama est ce qui se rapproche le plus d’une norme pour les LLM locaux. Installez-le, exécutez ollama run llama3.2:3b, et vous avez un modèle fonctionnant en moins d’une minute. Sous le capot, il utilise llama.cpp avec une bibliothèque de modèles conservée, une API compatible OpenAI sur localhost:11434 et la gestion de la mémoire par modèle.

Où il faiblit : Pas d’UI de chat intégrée ; vous utilisez ollama run dans un terminal ou vous l’associez à un client (Open WebUI, Msty ou Enchanted sur Mac). La bibliothèque de modèles sur ollama.com est conservée mais limitée par rapport à l’accès direct à Hugging Face.

Tarification :

Plateformes : Windows, macOS (Apple silicon et Intel), Linux.

Télécharger : ollama.com/download ou via Homebrew / apt.

Conclusion : Le meilleur backend, c’est tout. Installez-le même si vous prévoyez d’utiliser une interface différente par-dessus.

2. LM Studio, meilleur UI de bureau poli

LM Studio encapsule llama.cpp dans une application de bureau native avec un navigateur de modèles Hugging Face intégré, des téléchargements en un clic, des repères de performance par modèle et un serveur API compatible OpenAI. Les paramètres de déchargement du GPU sont exposés avec des valeurs par défaut sensées pour Intel Arc, AMD et Apple silicon.

Où il faiblit : Fermeture de source (bien que gratuit). Certains utilisateurs signalent que l’interface graphique consomme plus de RAM que le modèle lui-même sur les iGPU d’entrée de gamme.

Tarification :

Plateformes : Windows, macOS, Linux (bêta).

Télécharger : lmstudio.ai

Conclusion : Le meilleur point de départ pour les utilisateurs de iGPU qui préfèrent une interface graphique. Fourni avec les bons paramètres par défaut pour le matériel grand public.

3. GPT4All, meilleur bureau convivial pour débutants

GPT4All de Nomic est le plus accessible du lot. Installez, choisissez un modèle dans la barre latérale, et il télécharge et s’exécute. Le volet LocalDocs ajoute un RAG simple sur un dossier de fichiers sans configuration.

Où il faiblit : Catalogue de modèles plus petit que LM Studio. Plus lent sous Windows qu’Ollama ou LM Studio dans nos tests.

Tarification :

Plateformes : Windows, macOS, Linux.

Télécharger : nomic.ai/gpt4all

Conclusion : Le choix pour votre ami ou votre famille moins technique. Les met à exécuter un modèle local sans toucher à un terminal.

4. Jan, meilleur clone ChatGPT entièrement open source

Jan est une application de bureau entièrement open source qui imite l’interface de ChatGPT. Il exécute des modèles locaux via llama.cpp fourni, se connecte à des API distantes (OpenAI, Anthropic, Groq, Mistral) en option et stocke chaque conversation localement.

Où il faiblit : Basé sur Electron, donc l’empreinte RAM est plus lourde que les applications natives. Les conversations multi-tours perdent occasionnellement le contexte sur iGPU en raison de la troncature agressive du contexte.

Tarification :

Plateformes : Windows, macOS, Linux.

Télécharger : jan.ai

Conclusion : Le plus similaire à ChatGPT open. Mieux si vous voulez une seule application pour local plus optionnel distant.

5. Msty, meilleur tout en un avec RAG

Msty combine les modèles locaux, les API distantes, RAG sur documents et les conversations en vue fractionnée dans une application. Sa fonction “Knowledge Stacks” indexe des dossiers de PDF, de documents Word et de fichiers texte pour que vous puissiez discuter avec eux sans configurer une base de données vectorielle.

Où il faiblit : Code fermé. Le plan gratuit limite certaines fonctionnalités RAG avancées.

Tarification :

Plateformes : Windows, macOS, Linux.

Télécharger : msty.app

Conclusion : Le choix si vous voulez discuter de documents sans configurer un magasin vectoriel séparé.

6. KoboldCpp, meilleur pour le jeu de rôle et l’écriture créative

KoboldCpp a commencé comme un fork de llama.cpp destiné à l’écriture de forme longue et au jeu de rôle. Il dispose d’une interface web avec des informations mondiales, une mémoire de personnage et des livres de lore que les autres exécuteurs ne présentent pas. Le backend supporte Vulkan pour iGPU.

Où il faiblit : L’interface est dense avec des curseurs qui ne signifient quelque chose que pour les utilisateurs avancés. Pas vraiment conçu pour les flux de travail d’assistant de chat.

Tarification :

Plateformes : Windows, macOS, Linux.

Télécharger : KoboldCpp GitHub releases.

Conclusion : Choix de niche pour les écrivains et les joueurs de rôle qui veulent des personnages persistants.

7. Text Generation WebUI, meilleure expérimentation avancée

Text Generation WebUI (oobabooga) est le terrain de jeu des expérimentateurs. Il supporte llama.cpp, ExLlama, Transformers et d’autres backends, expose chaque paramètre de génération et s’intègre avec LoRA et le fine-tuning.

Où il faiblit : La configuration n’est pas pour les débutants ; attendez-vous à une installation de 30 minutes avec Python venv. L’interface web est fonctionnelle mais pas conçue.

Tarification :

Plateformes : Windows, macOS, Linux via Python.

Télécharger : oobabooga/text-generation-webui GitHub.

Conclusion : Le bon choix quand vous savez ce que vous voulez régler et ne pouvez pas l’obtenir dans une meilleure application.

8. AnythingLLM, meilleur RAG local sur documents

AnythingLLM est une application RAG construite à cet effet qui associe un LLM local (ou distant) à un magasin de documents. Pointez-le vers un dossier ou déposez des fichiers, et il les indexe dans une base de données vectorielle locale. Les espaces de travail multi-utilisateurs séparent les contextes pour différents projets.

Où il faiblit : Axé sur RAG ; le chat pur est possible mais pas le point. La configuration implique de choisir un modèle d’intégration séparément du modèle de chat, ce qui embrouille les débutants.

Tarification :

Plateformes : Windows, macOS, Linux, plus déploiement Docker pour l’auto-hébergement.

Télécharger : anythingllm.com ou Mintplex-Labs/anything-llm GitHub.

Conclusion : Le choix si la raison pour laquelle vous voulez l’IA locale est d’interroger votre propre collection de documents en privé.

Comment choisir le bon

La meilleure configuration appairée pour la plupart des utilisateurs de iGPU : Ollama comme backend + LM Studio ou Open WebUI comme client. Cela vous donne le backend le plus rapide avec l’interface la plus conviviale.

FAQ

Quelle est la meilleure application LLM locale pour Intel Arc iGPU ?

LM Studio et Ollama utilisent tous deux Vulkan et fonctionnent bien sur Intel Arc iGPU (Xe, Xe2, Xe-LPG). Le choix du modèle importe plus que le choix de l’application ; les quantifications Q4_K_M des modèles 7B à 8B sont le point idéal.

Puis-je exécuter des LLM locaux sur un APU Ryzen sans GPU discret ?

Oui. Les iGPU Radeon 780M / 890M des séries Ryzen 7000 et 8000 exécutent des modèles 7B à 10 à 20 jetons par seconde en quantification Q4 via Vulkan. Augmentez l’allocation de RAM système aux graphiques dans le BIOS si vous voulez charger des contextes plus grands.

Quel est le meilleur LLM local pour un MacBook avec M2 ou M3 ?

Apple silicon exécute Llama 3.1 8B, Qwen 3 8B et Mistral 7B à 20 à 40 jetons par seconde sur M2. LM Studio et Ollama utilisent tous deux Metal automatiquement. Sur 16 Go de mémoire unifiée, restez avec Q4_K_M ou Q5_K_M.

Dois-je connaître Python pour exécuter des modèles locaux ?

Non. Ollama, LM Studio, GPT4All, Jan et Msty sont tous des installations en un clic sans Python. Text Generation WebUI est l’exception.

Quelle application LLM locale est entièrement open source ?

Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI et AnythingLLM sont tous open source. LM Studio et Msty sont gratuits mais code fermé.

Combien de RAM me faut-il pour les LLM locaux ?

Pour les modèles 7B à 8B en quantification Q4, 16 Go de RAM système total sont viables et 32 Go sont confortables. iGPU partage la RAM du système, donc budgétisez en conséquence. Pour les modèles 13B à 14B, prévoyez un minimum de 32 Go.