
Un téléphone flagship moderne dispose de plus de RAM que la plupart des ordinateurs portables expédiés il y a cinq ans, et ne quitte jamais la poche de l’utilisateur. Cette combinaison est enfin suffisante pour exécuter des modèles de langage quantifiés de 4B et 7B sur l’appareil : sans factures d’API, sans données quittant le téléphone, sans limitation lorsque le Wi-Fi de l’avion s’éteint. Nous avons testé six applications Android qui rendent l’inférence LLM locale pratique, des téléchargements en un clic à la flexibilité au niveau de Termux. Voici les meilleures applications pour exécuter des LLM locaux sur les téléphones Android en 2026.
Ce qu’il faut rechercher dans une application LLM locale
Les compromis sont toujours les mêmes : qualité du modèle par rapport à la pression mémoire, latence par rapport à l’épuisement de la batterie, facilité de configuration par rapport à la commande.
- Catalogue de modèles. Les modèles au format GGUF et MLC devraient être à une seule touche, pas un téléchargement manuel Hugging Face.
- Quantification. Q4_K_M et Q5_K_M importent plus que le nombre de paramètres bruts sur un téléphone.
- Fenêtre contextuelle. 8k est utilisable, 32k est confortable, tout ce qui est plus petit se sent étroit en 2026.
- Plafond mémoire. Un téléphone avec 8 Go de RAM utilisable peut à peine contenir un modèle 7B Q4 plus le système d’exploitation.
- Isolement de fond. Un téléphone qui OOM pendant un appel vidéo parce que le LLM refuse de se décharger n’est pas utilisable.
- Compatibilité de l’API. Un point final local compatible avec OpenAI signifie que d’autres applications sur le téléphone peuvent pointer vers lui.
Comparaison rapide
| Application | Idéal pour | Catalogue de modèles | Max contexte | Open source |
|---|---|---|---|---|
| PocketPal AI | Kit de démarrage | GGUF d’Hugging Face | 8k par défaut | Oui |
| MLC Chat | Inférence accélérée par GPU | MLC pré-construit | 4k-8k | Oui |
| ChatterUI | Jeu de rôle et personnages | N’importe quel chemin GGUF | 16k+ | Oui |
| Layla Lite | Chat de personnage clé en main | GGUF curé | 8k | Freemium |
| Termux | Exécution directe de llama.cpp | N’importe quoi | Dépend du modèle | Oui |
| Google AI Edge Gallery | Démonstration Gemma et Phi | Catalogue Google | 4k | Oui |
Les 6 meilleures applications LLM locales pour Android en 2026
1. PocketPal AI, le kit de démarrage
PocketPal AI est l’application à recommander en premier. Le téléchargement du modèle est un navigateur Hugging Face recherchable à l’intérieur de l’application, la quantification est choisie dans une liste déroulante, et l’inférence utilise llama.cpp sous le capot. Le chargement d’un modèle 3B Q4_K_M sur un téléphone avec 12 Go de RAM prend environ dix secondes. L’interface de discussion prend en charge les invites système, l’édition des messages et un mode benchmark qui signale les jetons par seconde.
La compilation 2026 a ajouté un mode d’achèvement de texte aux côtés du chat, ce qui est utile pour les flux de travail de style autocomplétion plutôt que seulement les Q&A basées sur les tours.
Où il est court : Les paramètres par défaut favorisent la vitesse à la qualité sur les téléphones de milieu de gamme. Les discussions persistantes vivent dans un fichier SQLite sans chiffrement au repos.
Prix :
- Gratuit, open source (MIT).
Plateformes : Android 8.0 et ultérieur, mieux sur les chips avec 8 Go de RAM ou plus.
Conclusion : Installez ceci en premier. C’est le tremplin pour l’inférence locale sur Android.
2. MLC Chat, l’option accélérée par GPU
MLC Chat est livré avec des modèles pré-construits compilés pour le backend Vulkan ou OpenCL du téléphone par l’équipe MLC-LLM. Sur un Snapdragon 8 Gen 3 ou Tensor G4, cela signifie notablement meilleur tokens par seconde qu’un build CPU pur llama.cpp. La sélection du modèle est étroite mais curée : les builds des familles Gemma, Phi et Llama sont tous inclus.
Le compromis est la flexibilité. Les modèles MLC sont recompilés par les mainteneurs, donc un nouvel upload Hugging Face prend une ou deux semaines pour arriver.
Où il est court : Pas d’importations de modèles personnalisés. Le backend GPU rivalise avec le gestionnaire de mémoire partagée du système d’exploitation sur certains builds Samsung, causant des blocages occasionnels.
Prix :
- Gratuit, open source (Apache-2.0).
Plateformes : Android 8.0 et ultérieur, GPU avec Vulkan ou OpenCL.
Conclusion : Meilleure vitesse brute sur l’appareil quand l’utilisateur est disposé à ne fonctionner que ce que MLC a précompilé.
3. ChatterUI, le frontend de jeu de rôle et de personnages
ChatterUI est un frontend complet pour l’inférence locale avec des cartes de personnages de style SillyTavern, balayage de messages, discussions de groupe et invites de système par personnage. Il charge n’importe quel GGUF du stockage local, ce qui en fait le choix pour les utilisateurs qui ont déjà une collection Hugging Face mise en cache.
Le sélecteur de modèle d’instruction compte ici : mal associer un modèle de discussion Mistral sur une compilation Llama-3 affecte la qualité, et ChatterUI expose le choix explicitement.
Où il est court : La configuration est la plus raide de cette liste. Au premier lancement, l’utilisateur doit pointer vers un fichier de modèle, choisir un modèle de discussion et définir une longueur de contexte avant qu’il ne fasse quoi que ce soit.
Prix :
- Gratuit, open source (AGPL-3.0).
Plateformes : Android 8.0 et ultérieur.
Conclusion : Pour les utilisateurs expérimentés qui veulent SillyTavern sur le téléphone.
4. Layla Lite, le chat de personnage clé en main
Layla Lite est une compilation dépouillée de Layla AI avec un catalogue de modèles curé et une interface de discussion de personnage destinée aux utilisateurs qui souhaitent parler à un assistant dans le téléphone sans choisir les modèles de discussion. Les téléchargements sont quantifiés à l’avance et nommés d’après la personnalité plutôt que le modèle sous-jacent, ce qui est plus convivial pour les nouveaux venus dans l’espace.
Le Layla payant apporte la synthèse vocale, la génération d’images sur l’appareil et les entrées de vision.
Où il est court : Le niveau gratuit limite la sélection des modèles. La voix de personnage dans la compilation gratuite est coincée sur les petits modèles.
Prix :
- Niveau gratuit avec un petit catalogue curé.
- Le niveau payant déverrouille les modèles plus grands, la voix et les flux de travail d’image.
Plateformes : Android 9.0 et ultérieur.
Conclusion : Le choix pour les utilisateurs qui veulent une discussion sur l’appareil sans configurer quoi que ce soit.
5. Termux, l’option bricolage
Termux n’est pas une application LLM, c’est un shell Linux complet qui exécute llama.cpp, les binaires Ollama et les piles d’inférence Python en mode natif. Pour quiconque exécute déjà des modèles locaux sur un ordinateur portable, Termux est le chemin le plus court vers le même flux de travail sur le téléphone : pkg install llama-cpp, déposez GGUF dans ~/models, exécutez.
Couplé avec le module complémentaire Termux:API pour les scripts d’inférence à partir de Tasker ou d’un raccourci, qui est la chose la plus proche qu’Android ait pour un raccourci clavier pour le modèle local.
Où il est court : La compilation Play Store est obsolète. Utilisez la version F-Droid ou GitHub. La configuration est un shell, pas une interface utilisateur.
Prix :
- Gratuit, open source (GPL-3.0).
Plateformes : Android 7.0 et ultérieur.
Conclusion : Pour les utilisateurs qui préfèrent le CLI qu’ils connaissent déjà.
6. Google AI Edge Gallery, la boîte de démonstration Gemma
Google AI Edge Gallery est le vitrine officielle de l’inférence sur l’appareil de Google. Il est livré avec des variantes Gemma et Phi préconfigurées pour l’API d’inférence LLM de MediaPipe, plus des flux d’exemple pour la discussion, le résumé et la compréhension des images. C’est le moyen le plus rapide de voir à quoi ressemble un modèle Gemma moderne sur un téléphone sans choisir une compilation ou une quantification.
Le format de galerie sert également de référence : chaque fiche de modèle répertorie les jetons par seconde sur l’appareil, pour que l’utilisateur puisse comparer un Pixel 9 Pro à un Snapdragon de milieu de gamme en moins d’une minute.
Où il est court : Limité aux choix de Google. Pas un client de discussion à usage général.
Prix :
- Gratuit, open source (Apache-2.0).
Plateformes : Android 12 et ultérieur.
Conclusion : La démonstration propre pour juger si l’inférence sur l’appareil est assez rapide sur un téléphone donné avant d’installer quelque chose de plus lourd.
Comment choisir celui qui convient
- Si c’est votre premier modèle local : PocketPal AI.
- Si la vitesse compte plus que la sélection du modèle : MLC Chat.
- Si vous voulez des personnages et un contexte long : ChatterUI.
- Si vous voulez un assistant préchargé sans configuration : Layla Lite.
- Si vous exécutez déjà llama.cpp sur un ordinateur portable : Termux avec le paquet llama.cpp.
- Si vous voulez un benchmark avant de décider : Google AI Edge Gallery.
FAQ
Combien de RAM un téléphone Android a-t-il besoin pour exécuter un modèle de langage 7B ?
Un modèle 7B Q4_K_M quantifié nécessite environ 4,5 Go de RAM pour fonctionner à une vitesse utilisable, plus de l’espace pour le système d’exploitation et les applications en arrière-plan. En pratique, un téléphone 8 Go fonctionne si l’utilisateur ferme les onglets d’arrière-plan ; les téléphones 12 Go ou 16 Go le gèrent sans s’en apercevoir.
Les applications LLM locales drainent-elles la batterie ?
L’inférence active est lourde, similaire à un appel vidéo. Les applications inactives ne consomment pas la batterie car les modèles sont déchargés de la mémoire entre les discussions.
Puis-je exécuter un modèle local sans connexion Internet ?
Oui, c’est le point. Les téléchargements du modèle ont besoin d’Internet, mais l’inférence est entièrement hors ligne après.
Quelle quantification dois-je choisir ?
Q4_K_M est la valeur par défaut qui fonctionne sur la plupart des téléphones. Q5_K_M est meilleur s’il y a une RAM de rechange. En dessous de Q4, la qualité chute fortement et cela vaut rarement l’économie de mémoire.