PocketPal AI exécutant un modèle de langage local sur Android

Un téléphone flagship moderne dispose de plus de RAM que la plupart des ordinateurs portables expédiés il y a cinq ans, et ne quitte jamais la poche de l’utilisateur. Cette combinaison est enfin suffisante pour exécuter des modèles de langage quantifiés de 4B et 7B sur l’appareil : sans factures d’API, sans données quittant le téléphone, sans limitation lorsque le Wi-Fi de l’avion s’éteint. Nous avons testé six applications Android qui rendent l’inférence LLM locale pratique, des téléchargements en un clic à la flexibilité au niveau de Termux. Voici les meilleures applications pour exécuter des LLM locaux sur les téléphones Android en 2026.

Ce qu’il faut rechercher dans une application LLM locale

Les compromis sont toujours les mêmes : qualité du modèle par rapport à la pression mémoire, latence par rapport à l’épuisement de la batterie, facilité de configuration par rapport à la commande.

Comparaison rapide

Application Idéal pour Catalogue de modèles Max contexte Open source
PocketPal AI Kit de démarrage GGUF d’Hugging Face 8k par défaut Oui
MLC Chat Inférence accélérée par GPU MLC pré-construit 4k-8k Oui
ChatterUI Jeu de rôle et personnages N’importe quel chemin GGUF 16k+ Oui
Layla Lite Chat de personnage clé en main GGUF curé 8k Freemium
Termux Exécution directe de llama.cpp N’importe quoi Dépend du modèle Oui
Google AI Edge Gallery Démonstration Gemma et Phi Catalogue Google 4k Oui

Les 6 meilleures applications LLM locales pour Android en 2026

1. PocketPal AI, le kit de démarrage

PocketPal AI est l’application à recommander en premier. Le téléchargement du modèle est un navigateur Hugging Face recherchable à l’intérieur de l’application, la quantification est choisie dans une liste déroulante, et l’inférence utilise llama.cpp sous le capot. Le chargement d’un modèle 3B Q4_K_M sur un téléphone avec 12 Go de RAM prend environ dix secondes. L’interface de discussion prend en charge les invites système, l’édition des messages et un mode benchmark qui signale les jetons par seconde.

La compilation 2026 a ajouté un mode d’achèvement de texte aux côtés du chat, ce qui est utile pour les flux de travail de style autocomplétion plutôt que seulement les Q&A basées sur les tours.

Où il est court : Les paramètres par défaut favorisent la vitesse à la qualité sur les téléphones de milieu de gamme. Les discussions persistantes vivent dans un fichier SQLite sans chiffrement au repos.

Prix :

Plateformes : Android 8.0 et ultérieur, mieux sur les chips avec 8 Go de RAM ou plus.

Télécharger : AptoideGoogle Play

Conclusion : Installez ceci en premier. C’est le tremplin pour l’inférence locale sur Android.


2. MLC Chat, l’option accélérée par GPU

MLC Chat est livré avec des modèles pré-construits compilés pour le backend Vulkan ou OpenCL du téléphone par l’équipe MLC-LLM. Sur un Snapdragon 8 Gen 3 ou Tensor G4, cela signifie notablement meilleur tokens par seconde qu’un build CPU pur llama.cpp. La sélection du modèle est étroite mais curée : les builds des familles Gemma, Phi et Llama sont tous inclus.

Le compromis est la flexibilité. Les modèles MLC sont recompilés par les mainteneurs, donc un nouvel upload Hugging Face prend une ou deux semaines pour arriver.

Où il est court : Pas d’importations de modèles personnalisés. Le backend GPU rivalise avec le gestionnaire de mémoire partagée du système d’exploitation sur certains builds Samsung, causant des blocages occasionnels.

Prix :

Plateformes : Android 8.0 et ultérieur, GPU avec Vulkan ou OpenCL.

Télécharger : Google Play

Conclusion : Meilleure vitesse brute sur l’appareil quand l’utilisateur est disposé à ne fonctionner que ce que MLC a précompilé.


3. ChatterUI, le frontend de jeu de rôle et de personnages

ChatterUI est un frontend complet pour l’inférence locale avec des cartes de personnages de style SillyTavern, balayage de messages, discussions de groupe et invites de système par personnage. Il charge n’importe quel GGUF du stockage local, ce qui en fait le choix pour les utilisateurs qui ont déjà une collection Hugging Face mise en cache.

Le sélecteur de modèle d’instruction compte ici : mal associer un modèle de discussion Mistral sur une compilation Llama-3 affecte la qualité, et ChatterUI expose le choix explicitement.

Où il est court : La configuration est la plus raide de cette liste. Au premier lancement, l’utilisateur doit pointer vers un fichier de modèle, choisir un modèle de discussion et définir une longueur de contexte avant qu’il ne fasse quoi que ce soit.

Prix :

Plateformes : Android 8.0 et ultérieur.

Télécharger : F-Droid

Conclusion : Pour les utilisateurs expérimentés qui veulent SillyTavern sur le téléphone.


4. Layla Lite, le chat de personnage clé en main

Layla Lite est une compilation dépouillée de Layla AI avec un catalogue de modèles curé et une interface de discussion de personnage destinée aux utilisateurs qui souhaitent parler à un assistant dans le téléphone sans choisir les modèles de discussion. Les téléchargements sont quantifiés à l’avance et nommés d’après la personnalité plutôt que le modèle sous-jacent, ce qui est plus convivial pour les nouveaux venus dans l’espace.

Le Layla payant apporte la synthèse vocale, la génération d’images sur l’appareil et les entrées de vision.

Où il est court : Le niveau gratuit limite la sélection des modèles. La voix de personnage dans la compilation gratuite est coincée sur les petits modèles.

Prix :

Plateformes : Android 9.0 et ultérieur.

Télécharger : Google Play

Conclusion : Le choix pour les utilisateurs qui veulent une discussion sur l’appareil sans configurer quoi que ce soit.


5. Termux, l’option bricolage

Termux n’est pas une application LLM, c’est un shell Linux complet qui exécute llama.cpp, les binaires Ollama et les piles d’inférence Python en mode natif. Pour quiconque exécute déjà des modèles locaux sur un ordinateur portable, Termux est le chemin le plus court vers le même flux de travail sur le téléphone : pkg install llama-cpp, déposez GGUF dans ~/models, exécutez.

Couplé avec le module complémentaire Termux:API pour les scripts d’inférence à partir de Tasker ou d’un raccourci, qui est la chose la plus proche qu’Android ait pour un raccourci clavier pour le modèle local.

Où il est court : La compilation Play Store est obsolète. Utilisez la version F-Droid ou GitHub. La configuration est un shell, pas une interface utilisateur.

Prix :

Plateformes : Android 7.0 et ultérieur.

Télécharger : F-Droid

Conclusion : Pour les utilisateurs qui préfèrent le CLI qu’ils connaissent déjà.


Google AI Edge Gallery est le vitrine officielle de l’inférence sur l’appareil de Google. Il est livré avec des variantes Gemma et Phi préconfigurées pour l’API d’inférence LLM de MediaPipe, plus des flux d’exemple pour la discussion, le résumé et la compréhension des images. C’est le moyen le plus rapide de voir à quoi ressemble un modèle Gemma moderne sur un téléphone sans choisir une compilation ou une quantification.

Le format de galerie sert également de référence : chaque fiche de modèle répertorie les jetons par seconde sur l’appareil, pour que l’utilisateur puisse comparer un Pixel 9 Pro à un Snapdragon de milieu de gamme en moins d’une minute.

Où il est court : Limité aux choix de Google. Pas un client de discussion à usage général.

Prix :

Plateformes : Android 12 et ultérieur.

Télécharger : F-Droid

Conclusion : La démonstration propre pour juger si l’inférence sur l’appareil est assez rapide sur un téléphone donné avant d’installer quelque chose de plus lourd.

Comment choisir celui qui convient

FAQ

Combien de RAM un téléphone Android a-t-il besoin pour exécuter un modèle de langage 7B ?
Un modèle 7B Q4_K_M quantifié nécessite environ 4,5 Go de RAM pour fonctionner à une vitesse utilisable, plus de l’espace pour le système d’exploitation et les applications en arrière-plan. En pratique, un téléphone 8 Go fonctionne si l’utilisateur ferme les onglets d’arrière-plan ; les téléphones 12 Go ou 16 Go le gèrent sans s’en apercevoir.

Les applications LLM locales drainent-elles la batterie ?
L’inférence active est lourde, similaire à un appel vidéo. Les applications inactives ne consomment pas la batterie car les modèles sont déchargés de la mémoire entre les discussions.

Puis-je exécuter un modèle local sans connexion Internet ?
Oui, c’est le point. Les téléchargements du modèle ont besoin d’Internet, mais l’inférence est entièrement hors ligne après.

Quelle quantification dois-je choisir ?
Q4_K_M est la valeur par défaut qui fonctionne sur la plupart des téléphones. Q5_K_M est meilleur s’il y a une RAM de rechange. En dessous de Q4, la qualité chute fortement et cela vaut rarement l’économie de mémoire.