MLC Chat exécutant un LLM quantifié sur Android

Les meilleures applications pour exécuter des LLM quantifiés sur Android en 2026

Q4_K_M, Q5_K_S, Q8_0. Si ces étiquettes ne vous disent rien encore, c’est la raison pour laquelle un modèle de 7 milliards de paramètres tient désormais sur un téléphone de 6 GB. La quantification réduit les poids du modèle de nombres flottants 16 bits à des entiers 4 bits, ce qui compresse un modèle de chat de 14 GB à moins de 5 GB et permet à votre téléphone de l’exécuter sans facturation d’API cloud.

Nous avons testé sept applications sur un Pixel 8 et une tablette Snapdragon 8 Gen 2. Ce qui nous intéressait : quelles applications chargeaient les poids quantifiés GGUF et MLC sans ordinateur portable au milieu, lesquelles fonctionnaient hors ligne en mode avion, et lesquelles pouvaient tenir une conversation sans ralentir au point de devenir inutilisables.

Ce qu’il faut rechercher dans une application LLM sur appareil

Comparaison rapide

Application Meilleure pour Plan gratuit Prix de départ/mois Note
MLC Chat Noyaux MLC compilés, meilleur débit Oui (open source) Gratuit 4,4
PocketPal AI Modèles GGUF avec un catalogue convivial Oui (open source) Gratuit 4,6
Layla Chats de jeu de rôle et contexte long Niveau gratuit 9,99 $ une fois 4,5
Sherpa Shell llama.cpp minimal Oui (open source) Gratuit 4,2
LLMFarm Companion Synchronisation de modèle entre appareils Oui 4,99 $ une fois 4,3
ChatterUI Interface de chat multi-modèles Oui (open source) Gratuit 4,5
Enchanted Interface pour un serveur Ollama domestique Oui (open source) Gratuit 4,4

Les applications

1. MLC Chat — Meilleure pour les noyaux MLC compilés et le meilleur débit

MLC Chat fournit des modèles précompilés accordés au GPU Adreno ou Mali exact de votre téléphone. Cette étape de compilation est ce qui permet à un modèle Phi de 3 milliards de paramètres de fonctionner à 15+ jetons/seconde sur un Pixel 8, soit à peu près deux fois plus qu’un runtime GGUF générique. Le catalogue à l’intérieur de l’application est court mais soigné : Llama, Phi, Gemma, Mistral, RedPajama.

Points faibles : Pas de support pour les fichiers GGUF arbitraires. Si vous avez déjà un modèle téléchargé, vous ne pouvez pas le charger ici sans le recompiler pour MLC.

Tarification :

Plates-formes : Android 8.0 et versions supérieures.

Télécharger : Aptoide

En résumé : Choisissez MLC Chat quand le nombre maximum de jetons par seconde importe et que vous pouvez vivre avec le catalogue fixe.

2. PocketPal AI — Meilleure pour les modèles GGUF avec un catalogue convivial

PocketPal AI charge n’importe quel GGUF vers lequel vous le pointez. La recherche dans l’application parcourt Hugging Face sans basculer vers un navigateur, et l’écran de téléchargement affiche le niveau de quantification, la taille et une estimation approximative des jetons par seconde pour votre appareil avant que vous ne vous engagiez à 4 GB sur le disque. L’historique de conversation reste sur l’appareil.

Points faibles : L’accélération GPU est derrière MLC sur le même téléphone. Les conversations contexte long consomment rapidement la RAM sur les appareils 6 GB.

Tarification :

Plates-formes : Android 9.0 et versions supérieures.

Télécharger : Google Play

En résumé : La façon la plus conviviale d’accéder pour quiconque débute avec la quantification GGUF sur Android.

3. Layla — Meilleure pour les jeux de rôle et les chats contexte long

Layla cible la foule des jeux de rôle et de l’écriture de longues histoires. Elle est livrée avec des modèles d’invite, des imports de cartes de caractères et des fenêtres de contexte par défaut plus grandes accordées pour maintenir la continuité du scénario sur de nombreux tours. Exécute GGUF localement ; un niveau payant ajoute l’entrée vocale et des modèles premium.

Points faibles : L’interface est chargée. Certains personnages préétablis sont orientés pour adultes ; le filtre de sécurité nécessite un réglage manuel pour une utilisation familiale.

Tarification :

Plates-formes : Android 9.0 et versions supérieures.

Télécharger : Google Play

En résumé : Choisissez Layla si la raison pour laquelle vous voulez un modèle local est l’écriture de fiction qu’un modèle cloud refuserait.

4. Sherpa — Meilleure pour un shell llama.cpp minimal

Sherpa est l’application pour les gens qui savent déjà ce qu’ils veulent. Pointez-le vers un fichier GGUF sur la carte SD, réglez votre longueur de contexte et le nombre de threads, et c’est parti. Pas de catalogue, pas de synchronisation, pas de superflu.

Points faibles : Aucune prise en main. Les débutants peuvent charger un modèle qui ne rentrera pas et faire planter l’application.

Tarification :

Plates-formes : Android 8.0 et versions supérieures.

Télécharger : F-Droid

En résumé : Pour les utilisateurs avancés qui veulent un runtime llama.cpp sans wrapper d’application de chat.

5. LLMFarm Companion — Meilleure pour la synchronisation de modèles entre appareils

LLMFarm a commencé sur iOS et dispose d’un compagnon Android qui reflète le même catalogue et la même bibliothèque d’invites. Utile si vous partagez votre temps entre un iPad et une tablette Android et que vous voulez les mêmes caractères et les mêmes invites système sur les deux.

Points faibles : Moins de bascules de format que PocketPal. Le support GPU sur Adreno est encore en rattrapage.

Tarification :

Plates-formes : Android 10 et versions supérieures.

Télécharger : Google Play

En résumé : Choisissez ceci si vous utilisez déjà LLMFarm sur iOS et que vous voulez la parité des invites.

6. ChatterUI — Meilleure interface de chat multi-modèles

ChatterUI traite chaque backend de la même manière, que vous exécutiez llama.cpp sur le téléphone, KoboldCpp sur un ordinateur portable ou Ollama sur un serveur domestique. Basculez en milieu de conversation d’un petit modèle local à un modèle distant plus puissant sans perdre le fil.

Points faibles : Configuration lourde au premier lancement. Pas d’opinion sur le modèle à choisir, donc les débutants s’arrêtent au sélecteur.

Tarification :

Plates-formes : Android 8.0 et versions supérieures.

Télécharger : GitHub Releases

En résumé : Le bon choix quand le téléphone n’est qu’un des plusieurs endroits où vous exécutez l’inférence.

7. Enchanted — Meilleure interface pour un serveur Ollama domestique

Enchanted n’est pas lui-même un moteur sur l’appareil. C’est une application de chat soignée qui parle à une instance Ollama que vous exécutez sur un ordinateur portable ou un serveur domestique. En déplacement, utilisez un modèle quantifié local dans l’une des applications ci-dessus ; à la maison, accédez à Enchanted pour un modèle plus volumineux que votre téléphone ne peut pas héberger.

Points faibles : Nécessite une machine quelque part exécutant Ollama. Nécessite un tunnel ou une accessibilité LAN pour une utilisation à distance.

Tarification :

Plates-formes : Android 9.0 et versions supérieures.

Télécharger : GitHub Releases

En résumé : Associez-le à n’importe quelle application sur l’appareil pour les jours où votre téléphone ne peut pas contenir le modèle que vous voulez.

Comment choisir la bonne

Les acronymes sont moins effrayants une fois que vous les utilisez. Une quantification Q4_K_M de Llama 3.1 8B s’adapte confortablement sur n’importe quel téléphone 8 GB ; une Q8_0 de Phi-3 Mini fonctionne étonnamment bien sur un téléphone 6 GB. Commencez par là, observez les jetons par seconde, et augmentez ou diminuez.

FAQ

Que signifie vraiment Q4_K_M ?

Q4 signifie quantification 4 bits des poids du modèle. K se réfère aux k-quants, un regroupement plus intelligent introduit par llama.cpp. M est la variante médium, qui mélange certains tenseurs 5 bits pour la qualité. En pratique : Q4_K_M est le niveau « suffisamment bon par défaut ».

Combien de RAM un modèle sur l’appareil nécessite-t-il ?

Règle empirique : taille du fichier du modèle plus 30% pour le runtime et le cache de contexte. Un modèle de 4 GB nécessite environ 5,5 GB libres. Les téléphones avec 8 GB ou plus de RAM gèrent les modèles 7B à Q4 ; les téléphones 6 GB s’en tiennent à 3B.

Mon téléphone va-t-il surchauffer ?

L’inférence soutenue sur un téléphone milieu de gamme causera un ralentissement thermique en quelques minutes. Préférez les appareils Snapdragon 8 Gen 2/3 ou Tensor G4 plus récents, et gardez le téléphone sur une surface dure pendant son fonctionnement.

Ces applications envoient-elles mes invites quelque part ?

L’inférence sur l’appareil reste sur l’appareil. Enchanted et ChatterUI sont des exceptions lorsqu’ils sont configurés pour parler à un backend distant. Lisez les invites réseau de chaque application au premier lancement.

Quel modèle devrais-je commencer avec ?

Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M ou Gemma 2 2B sont les points de départ sûrs pour un téléphone Android moderne. Passez à Llama 3.1 8B si l’appareil a 12 GB de RAM ou plus.