llama.cpp

XDA a publié un article ce mois-ci arguant qu’une pile IA locale plus petite est une pile IA locale plus productive. L’auteur avait accumulé le bazar habituel : deux lanceurs de modèles, trois interfaces utilisateur, une base de données vectorielle que personne n’utilisait et un dossier d’adaptateurs qu’il avait oublié. Réduire à un ensemble minimal a rendu la configuration plus facile à maintenir et plus facile d’accès. Nous avons testé huit des meilleures applications pour une pile IA locale minimaliste sur bureau, sur un MacBook Pro M3, une station de travail Windows avec une RTX 4070 et une boîte Debian avec une AMD 7800 XT, en nous concentrant sur la façon dont chacune se comporte comme le seul outil de la pile plutôt que l’un des nombreux.

Ce qu’il faut rechercher dans une application IA locale minimaliste

Comparaison rapide

Application Meilleur pour Plates-formes Plan gratuit Prix de départ Caractéristique remarquable
llama.cpp Runtime de référence Windows, macOS, Linux Gratuit, open source Gratuit Inférence binaire unique portable
llamafile Un fichier, pas d’installation Windows, macOS, Linux Gratuit, open source Gratuit Modèle plus runtime dans un exécutable
Ollama CLI plus simple plus API Windows, macOS, Linux Gratuit, open source Gratuit ollama run et vous avez un point de terminaison OpenAI
Jan Interface utilisateur de bureau native avec API Windows, macOS, Linux Gratuit, open source Gratuit Chat de bureau multiplateforme
KoboldCpp Interface utilisateur binaire unique plus API Windows, macOS, Linux Gratuit, open source Gratuit Exécuteur GGUF avec interface web intégrée
Msty Interface utilisateur commerciale polie sur modèles locaux Windows, macOS, Linux Niveau gratuit Abonnement Msty pour fonctionnalités avancées Interface de chat multi-modèles
GPT4All Chat de bureau le plus simple Windows, macOS, Linux Gratuit, open source Gratuit Convivial pour les débutants, pas de CLI
LM Studio Exécuteur local complet Windows, macOS, Linux Gratuit pour usage personnel Licence commerciale Interface de découverte de modèles, large support backend

Les applications

1. llama.cpp — Meilleur pour le runtime de référence sur lequel tout le monde construit

llama.cpp est le runtime que la plupart de cette liste enveloppe d’une façon ou d’une autre. C’est un serveur d’inférence C++ portable et sans dépendances qui exécute les modèles GGUF sur CPU, Metal, CUDA et ROCm. En tant que pile minimaliste en soi, llama-server vous donne un point de terminaison compatible avec OpenAI, et llama-cli vous donne un REPL. C’est suffisant pour la plupart des travaux d’IA locale.

Où ça fait défaut : Pas d’interface utilisateur polie. Vous compilez ou téléchargez un binaire de version. La gestion des modèles est manuelle.

Tarification :

Plates-formes : Windows, macOS, Linux

Télécharger : github.com/ggerganov/llama.cpp

En résumé : llama.cpp est le choix lorsque vous voulez le moins de pièces mobiles et que vous êtes à l’aise dans un terminal.

2. llamafile — Meilleur pour un runtime et un modèle dans un exécutable

llamafile du projet Mozilla Ocho combine un modèle et le runtime llama.cpp en un seul binaire Cosmopolitan-libc qui s’exécute sur Windows, macOS et Linux sans installation. Téléchargez le fichier, chmod-le, exécutez-le. Il ouvre une interface utilisateur du navigateur et expose une API compatible avec OpenAI sur localhost. C’est l’interprétation la plus littérale d’« IA locale minimaliste » de la liste.

Où ça fait défaut : Les fichiers binaires portables uniques peuvent déclencher des outils de sécurité hôte. Télécharger un nouveau modèle signifie télécharger un nouveau llamafile.

Tarification :

Plates-formes : Windows, macOS, Linux

Télécharger : github.com/Mozilla-Ocho/llamafile

En résumé : llamafile est le choix lorsque l’installation doit être un fichier et un seul.

3. Ollama — Meilleur pour le flux de travail CLI plus simple plus API

Ollama enveloppe llama.cpp avec l’expérience d’installation et de commande la plus propre de tout ce qui se trouve sur cette liste. ollama pull llama3.2:8b télécharge un modèle. ollama run llama3.2:8b ouvre un chat. ollama serve expose un point de terminaison compatible avec OpenAI sur le port 11434 par défaut. Le format Modelfile vous permet d’épingler les invites système et les paramètres avec un seul fichier texte.

Où ça fait défaut : L’installation par défaut exécute le serveur en tant que service d’arrière-plan que vous ne voudrez peut-être pas. La quantification manuelle des modèles est limitée par rapport au llama.cpp brut.

Tarification :

Plates-formes : Windows, macOS, Linux

Télécharger : ollama.com

En résumé : Ollama est le choix lorsque l’installation en une commande et l’exécution en une commande sont la barre minimale.

4. Jan — Meilleur pour une interface utilisateur de bureau native que vous possédez

Jan est une application de bureau créée à partir de zéro pour les modèles locaux, open source, avec un serveur API compatible avec OpenAI intégré. C’est ce que vous installez lorsque vous voulez une véritable interface utilisateur de chat de bureau sans la surface de LM Studio. L’équipe livre des compilations pour les trois systèmes d’exploitation et maintient le flux de découverte des modèles simple.

Où ça fait défaut : Projet plus jeune que LM Studio ou Ollama. Certaines fonctionnalités avancées (backends spécialisés, personnalisation profonde des modèles) sont à la traîne.

Tarification :

Plates-formes : Windows, macOS, Linux

Télécharger : jan.ai

En résumé : Jan est le choix lorsqu’une véritable interface utilisateur de bureau est le facteur décisif.

5. KoboldCpp — Meilleur pour une interface utilisateur binaire unique plus API sur une cible portable

KoboldCpp a commencé comme un fork de llama.cpp destiné à la communauté KoboldAI, et s’est développé en un exécuteur GGUF binaire unique avec une interface utilisateur de navigateur, un point de terminaison API, une prise en charge d’entrée d’image et d’audio, et aucune étape d’installation. Placez le binaire et un GGUF à côté, exécutez une commande et c’est tout.

Où ça fait défaut : Certaines fonctionnalités spécialisées (intégration Horde, invites spécifiques à KoboldAI) n’importent pas pour un cas d’usage de chat général.

Tarification :

Plates-formes : Windows, macOS, Linux

Télécharger : github.com/LostRuins/koboldcpp

En résumé : KoboldCpp est le choix lorsque vous voulez un seul binaire qui vous donne à la fois une interface utilisateur et une API sans une application plus lourde.

6. Msty — Meilleur pour une interface utilisateur commerciale polie sur modèles locaux

Msty prend l’approche LM Studio et produit une interface utilisateur plus propre. Chattez côte à côte avec plusieurs modèles, connectez-vous à des points de terminaison Ollama ou Jan locaux, et organisez les conversations dans des dossiers. Le niveau gratuit est généreux ; le niveau payant déverrouille les fonctionnalités multi-utilisateurs et d’espace de travail.

Où ça fait défaut : Code source fermé. Pas dans le sens minimaliste « installer un seul binaire open source ». Pour un utilisateur solo qui préfère le polissage aux principes, c’est bien.

Tarification :

Plates-formes : Windows, macOS, Linux

Télécharger : msty.app

En résumé : Msty est le choix lorsque le polissage de l’interface utilisateur vaut la peine de renoncer à la contrainte open source.

7. GPT4All — Meilleur pour un chat de bureau convivial pour les débutants

GPT4All de Nomic est le moyen le plus convivial pour lancer un LLM local pour quelqu’un qui ne veut pas toucher un terminal. Installez l’application, parcourez une liste de modèles conservée, choisissez-en un, discutez. Il expose également une API locale et s’intègre à Nomic Atlas pour la RAG basée sur les documents si vous décidez d’aller au-delà du chat.

Où ça fait défaut : La liste des modèles conservée est un petit sous-ensemble de ce qui est disponible sur Hugging Face. Les utilisateurs avancés s’en éloignent.

Tarification :

Plates-formes : Windows, macOS, Linux

Télécharger : gpt4all.io

En résumé : GPT4All est le choix pour un utilisateur d’IA locale pour la première fois qui veut une application de bureau qui fonctionne simplement.

8. LM Studio — Meilleur pour un exécuteur local complet

LM Studio est le bout maximaliste d’« encore une seule application de bureau ». Découverte de modèles à partir de Hugging Face, support de plusieurs backends (llama.cpp, MLX sur Apple Silicon), interface utilisateur de chat complète, serveur API et surface de configuration des modèles qui expose tout. C’est à quoi les gens se raccordent par défaut lorsque la simplicité d’Ollama est trop limitée.

Où ça fait défaut : Pas open source. Empreinte d’installation plus grande que les choix ci-dessus. La surface des fonctionnalités maximalistes est le contraire de la pile minimaliste que défendait l’article de XDA, mais elle est incluse ici comme point de référence pour ce qui se passe lorsque vous refusez de réduire.

Tarification :

Plates-formes : Windows, macOS, Linux

Télécharger : lmstudio.ai

En résumé : LM Studio est le choix lorsqu’un exécuteur local complet vaut le coût d’une installation plus grande que n’importe laquelle des options ci-dessus.

Comment choisir le bon

FAQ

Quel modèle dois-je exécuter sur 16 GB de RAM ? Une quantification Q4 d’un modèle 7B ou 8B fonctionne bien dans cette enveloppe et couvre la plupart des cas d’usage de chat et de codage. La quantification Q4 d’un 13B est possible mais serrée.

Ces applications fonctionnent-elles sur Apple Silicon ? Oui. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio et Msty utilisent tous Metal sur Apple Silicon et obtiennent une vitesse quasi-native. llamafile est livré avec des binaires Apple Silicon.

Puis-je pointer les outils de style ChatGPT vers un modèle local ? Oui. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio et llamafile exposent tous un point de terminaison compatible avec OpenAI sur localhost. Pointez n’importe quel outil qui accepte une URL de base personnalisée vers http://localhost:<port>/v1.

En quoi une pile minimaliste diffère-t-elle d’une pile maximaliste ? Moins de pièces mobiles. Un runtime, un gestionnaire de modèles, une interface utilisateur. Les piles maximalistes ajoutent des bases de données vectorielles, des couches d’orchestration et des frameworks d’agents. La plupart des utilisateurs seuls n’ont besoin d’aucun d’entre eux jusqu’à ce qu’un problème spécifique l’exige.

Lesquels d’entre eux sont capables d’agent prêts à l’emploi ? Non. Il s’agit de runtimes d’inférence et d’interfaces utilisateur de chat. Pour une boucle d’agent, vous ajoutez un outil séparé qui parle le protocole OpenAI Chat Completions contre l’un de ces points de terminaison.

Quelle pile est la plus petite sur le disque ? llamafile plus un seul modèle quantifié est l’installation la plus légère possible. Ollama plus son magasin de modèles est un close-second et plus facile de croître.