
Les meilleures applications pour exécuter des LLM quantifiés sur Android en 2026
Q4_K_M, Q5_K_S, Q8_0. Si ces étiquettes ne vous disent rien encore, c’est la raison pour laquelle un modèle de 7 milliards de paramètres tient désormais sur un téléphone de 6 GB. La quantification réduit les poids du modèle de nombres flottants 16 bits à des entiers 4 bits, ce qui compresse un modèle de chat de 14 GB à moins de 5 GB et permet à votre téléphone de l’exécuter sans facturation d’API cloud.
Nous avons testé sept applications sur un Pixel 8 et une tablette Snapdragon 8 Gen 2. Ce qui nous intéressait : quelles applications chargeaient les poids quantifiés GGUF et MLC sans ordinateur portable au milieu, lesquelles fonctionnaient hors ligne en mode avion, et lesquelles pouvaient tenir une conversation sans ralentir au point de devenir inutilisables.
Ce qu’il faut rechercher dans une application LLM sur appareil
- Support des formats de quantification courants : GGUF (style llama.cpp) ou MLC (noyaux compilés).
- Un catalogue de modèles que vous pouvez parcourir sans coller les URL de Hugging Face.
- Historique de conversation persistant enregistré localement, non transmis à un serveur.
- Affichage du nombre de jetons par seconde, pour savoir quand un modèle est trop lourd pour le téléphone.
- Bascules d’inférence CPU vs GPU vs NPU, car un NPU Snapdragon 8-series peut doubler le débit.
- Fonctionnement en mode avion. Si cela nécessite du Wi-Fi pour répondre à « bonjour », ce n’est pas sur l’appareil.
Comparaison rapide
| Application | Meilleure pour | Plan gratuit | Prix de départ/mois | Note |
|---|---|---|---|---|
| MLC Chat | Noyaux MLC compilés, meilleur débit | Oui (open source) | Gratuit | 4,4 |
| PocketPal AI | Modèles GGUF avec un catalogue convivial | Oui (open source) | Gratuit | 4,6 |
| Layla | Chats de jeu de rôle et contexte long | Niveau gratuit | 9,99 $ une fois | 4,5 |
| Sherpa | Shell llama.cpp minimal | Oui (open source) | Gratuit | 4,2 |
| LLMFarm Companion | Synchronisation de modèle entre appareils | Oui | 4,99 $ une fois | 4,3 |
| ChatterUI | Interface de chat multi-modèles | Oui (open source) | Gratuit | 4,5 |
| Enchanted | Interface pour un serveur Ollama domestique | Oui (open source) | Gratuit | 4,4 |
Les applications
1. MLC Chat — Meilleure pour les noyaux MLC compilés et le meilleur débit
MLC Chat fournit des modèles précompilés accordés au GPU Adreno ou Mali exact de votre téléphone. Cette étape de compilation est ce qui permet à un modèle Phi de 3 milliards de paramètres de fonctionner à 15+ jetons/seconde sur un Pixel 8, soit à peu près deux fois plus qu’un runtime GGUF générique. Le catalogue à l’intérieur de l’application est court mais soigné : Llama, Phi, Gemma, Mistral, RedPajama.
Points faibles : Pas de support pour les fichiers GGUF arbitraires. Si vous avez déjà un modèle téléchargé, vous ne pouvez pas le charger ici sans le recompiler pour MLC.
Tarification :
- Gratuit : Apache 2.0 open source.
- Payant : N/A.
Plates-formes : Android 8.0 et versions supérieures.
En résumé : Choisissez MLC Chat quand le nombre maximum de jetons par seconde importe et que vous pouvez vivre avec le catalogue fixe.
2. PocketPal AI — Meilleure pour les modèles GGUF avec un catalogue convivial
PocketPal AI charge n’importe quel GGUF vers lequel vous le pointez. La recherche dans l’application parcourt Hugging Face sans basculer vers un navigateur, et l’écran de téléchargement affiche le niveau de quantification, la taille et une estimation approximative des jetons par seconde pour votre appareil avant que vous ne vous engagiez à 4 GB sur le disque. L’historique de conversation reste sur l’appareil.
Points faibles : L’accélération GPU est derrière MLC sur le même téléphone. Les conversations contexte long consomment rapidement la RAM sur les appareils 6 GB.
Tarification :
- Gratuit : MIT open source.
- Payant : N/A.
Plates-formes : Android 9.0 et versions supérieures.
En résumé : La façon la plus conviviale d’accéder pour quiconque débute avec la quantification GGUF sur Android.
3. Layla — Meilleure pour les jeux de rôle et les chats contexte long
Layla cible la foule des jeux de rôle et de l’écriture de longues histoires. Elle est livrée avec des modèles d’invite, des imports de cartes de caractères et des fenêtres de contexte par défaut plus grandes accordées pour maintenir la continuité du scénario sur de nombreux tours. Exécute GGUF localement ; un niveau payant ajoute l’entrée vocale et des modèles premium.
Points faibles : L’interface est chargée. Certains personnages préétablis sont orientés pour adultes ; le filtre de sécurité nécessite un réglage manuel pour une utilisation familiale.
Tarification :
- Gratuit : Chat de base avec quelques modèles préétablis.
- Payant : 9,99 $ une fois (Pro) déverrouille la voix, les modèles plus volumineux et la synchronisation cloud.
Plates-formes : Android 9.0 et versions supérieures.
En résumé : Choisissez Layla si la raison pour laquelle vous voulez un modèle local est l’écriture de fiction qu’un modèle cloud refuserait.
4. Sherpa — Meilleure pour un shell llama.cpp minimal
Sherpa est l’application pour les gens qui savent déjà ce qu’ils veulent. Pointez-le vers un fichier GGUF sur la carte SD, réglez votre longueur de contexte et le nombre de threads, et c’est parti. Pas de catalogue, pas de synchronisation, pas de superflu.
Points faibles : Aucune prise en main. Les débutants peuvent charger un modèle qui ne rentrera pas et faire planter l’application.
Tarification :
- Gratuit : MIT license.
- Payant : N/A.
Plates-formes : Android 8.0 et versions supérieures.
En résumé : Pour les utilisateurs avancés qui veulent un runtime llama.cpp sans wrapper d’application de chat.
5. LLMFarm Companion — Meilleure pour la synchronisation de modèles entre appareils
LLMFarm a commencé sur iOS et dispose d’un compagnon Android qui reflète le même catalogue et la même bibliothèque d’invites. Utile si vous partagez votre temps entre un iPad et une tablette Android et que vous voulez les mêmes caractères et les mêmes invites système sur les deux.
Points faibles : Moins de bascules de format que PocketPal. Le support GPU sur Adreno est encore en rattrapage.
Tarification :
- Gratuit : Chat de base.
- Payant : 4,99 $ une fois supprime les restrictions de taille de modèle.
Plates-formes : Android 10 et versions supérieures.
En résumé : Choisissez ceci si vous utilisez déjà LLMFarm sur iOS et que vous voulez la parité des invites.
6. ChatterUI — Meilleure interface de chat multi-modèles
ChatterUI traite chaque backend de la même manière, que vous exécutiez llama.cpp sur le téléphone, KoboldCpp sur un ordinateur portable ou Ollama sur un serveur domestique. Basculez en milieu de conversation d’un petit modèle local à un modèle distant plus puissant sans perdre le fil.
Points faibles : Configuration lourde au premier lancement. Pas d’opinion sur le modèle à choisir, donc les débutants s’arrêtent au sélecteur.
Tarification :
- Gratuit : GPLv3 open source.
- Payant : N/A.
Plates-formes : Android 8.0 et versions supérieures.
Télécharger : GitHub Releases
En résumé : Le bon choix quand le téléphone n’est qu’un des plusieurs endroits où vous exécutez l’inférence.
7. Enchanted — Meilleure interface pour un serveur Ollama domestique
Enchanted n’est pas lui-même un moteur sur l’appareil. C’est une application de chat soignée qui parle à une instance Ollama que vous exécutez sur un ordinateur portable ou un serveur domestique. En déplacement, utilisez un modèle quantifié local dans l’une des applications ci-dessus ; à la maison, accédez à Enchanted pour un modèle plus volumineux que votre téléphone ne peut pas héberger.
Points faibles : Nécessite une machine quelque part exécutant Ollama. Nécessite un tunnel ou une accessibilité LAN pour une utilisation à distance.
Tarification :
- Gratuit : MIT open source.
- Payant : N/A.
Plates-formes : Android 9.0 et versions supérieures.
Télécharger : GitHub Releases
En résumé : Associez-le à n’importe quelle application sur l’appareil pour les jours où votre téléphone ne peut pas contenir le modèle que vous voulez.
Comment choisir la bonne
- Si vous voulez les jetons par seconde les plus rapides et pouvez vivre avec un catalogue fixe : choisissez MLC Chat.
- Si vous voulez parcourir et télécharger des modèles GGUF depuis Hugging Face à l’intérieur de l’application : choisissez PocketPal AI.
- Si votre objectif est l’écriture de fiction et les chats contexte long : choisissez Layla.
- Si vous connaissez déjà llama.cpp et voulez un shell minimal : choisissez Sherpa.
- Si vous partagez votre temps entre iOS et Android : choisissez LLMFarm Companion.
- Si vous voulez basculer entre les backends locaux et distants en milieu de chat : choisissez ChatterUI.
- Si un serveur Ollama domestique est votre principal hôte de modèles : associez Enchanted à l’un des éléments ci-dessus pour les jours hors ligne.
Les acronymes sont moins effrayants une fois que vous les utilisez. Une quantification Q4_K_M de Llama 3.1 8B s’adapte confortablement sur n’importe quel téléphone 8 GB ; une Q8_0 de Phi-3 Mini fonctionne étonnamment bien sur un téléphone 6 GB. Commencez par là, observez les jetons par seconde, et augmentez ou diminuez.
FAQ
Que signifie vraiment Q4_K_M ?
Q4 signifie quantification 4 bits des poids du modèle. K se réfère aux k-quants, un regroupement plus intelligent introduit par llama.cpp. M est la variante médium, qui mélange certains tenseurs 5 bits pour la qualité. En pratique : Q4_K_M est le niveau « suffisamment bon par défaut ».
Combien de RAM un modèle sur l’appareil nécessite-t-il ?
Règle empirique : taille du fichier du modèle plus 30% pour le runtime et le cache de contexte. Un modèle de 4 GB nécessite environ 5,5 GB libres. Les téléphones avec 8 GB ou plus de RAM gèrent les modèles 7B à Q4 ; les téléphones 6 GB s’en tiennent à 3B.
Mon téléphone va-t-il surchauffer ?
L’inférence soutenue sur un téléphone milieu de gamme causera un ralentissement thermique en quelques minutes. Préférez les appareils Snapdragon 8 Gen 2/3 ou Tensor G4 plus récents, et gardez le téléphone sur une surface dure pendant son fonctionnement.
Ces applications envoient-elles mes invites quelque part ?
L’inférence sur l’appareil reste sur l’appareil. Enchanted et ChatterUI sont des exceptions lorsqu’ils sont configurés pour parler à un backend distant. Lisez les invites réseau de chaque application au premier lancement.
Quel modèle devrais-je commencer avec ?
Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M ou Gemma 2 2B sont les points de départ sûrs pour un téléphone Android moderne. Passez à Llama 3.1 8B si l’appareil a 12 GB de RAM ou plus.